选项
首页
新闻
新的AGI测试证明了具有挑战性,大多数AI模型

新的AGI测试证明了具有挑战性,大多数AI模型

2025-04-10
230

Arc奖基金会,由著名AI研究者弗朗索瓦·肖莱共同创立,最近在一篇博客文章中公布了一个名为ARC-AGI-2的新基准测试。该测试旨在推动AI通用智能的边界,到目前为止,对于大多数AI模型来说,这是一个难以破解的难题。

根据Arc奖排行榜,即使是像OpenAI的o1-pro和DeepSeek的R1这样的高级“推理”AI模型,也只能取得1%到1.3%的分数。同时,强大的非推理模型,如GPT-4.5、Claude 3.7 Sonnet和Gemini 2.0 Flash,也仅在1%左右徘徊。

ARC-AGI测试通过类似拼图的问题挑战AI系统,要求它们识别不同颜色方块网格中的视觉模式,并生成正确的“答案”网格。这些问题旨在测试AI适应全新、未见过挑战的能力。

为了建立人类基准,Arc奖基金会有超过400人参加了ARC-AGI-2测试。平均而言,这些“测试小组”的人类取得了60%的成功率,显著优于AI模型。

ARC-AGI-2的一个示例问题。图片来源:Arc奖
弗朗索瓦·肖莱在X上表示,与其前身ARC-AGI-1相比,ARC-AGI-2是衡量AI模型真实智能的更准确标准。Arc奖基金会的测试旨在评估AI是否能高效学习超出其训练数据的新技能。

肖莱强调,ARC-AGI-2防止AI模型依赖“暴力计算”来解决问题,这是他承认的第一个测试中的缺陷。为此,ARC-AGI-2引入了效率指标,并要求模型即时解读模式,而不是依赖记忆。

在博客文章中,Arc奖基金会共同创始人格雷格·卡姆拉特强调,智能不仅仅是解决问题或取得高分。他写道:“这些能力被获取和部署的效率是一个关键的定义组成部分。核心问题不仅是‘AI能否获得解决任务的技能?’,还有‘以何种效率或成本?’”

ARC-AGI-1在大约五年内未被击败,直到2024年12月,OpenAI的高级推理模型o3超越了所有其他AI模型,并达到了人类表现水平。然而,o3在ARC-AGI-1上的成功付出了巨大成本。OpenAI的o3模型版本o3 (low)在ARC-AGI-1上取得了令人印象深刻的75.7%分数,但在ARC-AGI-2上仅取得4%的成绩,每项任务使用了价值200美元的计算能力。

前沿AI模型在ARC-AGI-1和ARC-AGI-2上的性能比较。图片来源:Arc奖
ARC-AGI-2的推出正值科技行业许多人呼吁新的、未饱和的基准来衡量AI进展之际。Hugging Face的共同创始人托马斯·沃尔夫最近对TechCrunch表示,AI行业缺乏足够的测试来衡量人工通用智能的关键特质,如创造力。

除了新基准外,Arc奖基金会还宣布了2025年Arc奖竞赛,挑战开发者在ARC-AGI-2测试中实现85%的准确率,同时每项任务仅花费0.42美元。

相关文章
RSI 已成为新的 AGI,同样难以定义 RSI 已成为新的 AGI,同样难以定义 “递归”一词已成为人工智能领域的最新热词。 已有两家各具特色的初创公司将其作为公司名称,还有许多其他公司现在也在其开发计划中提及“递归自我改进”(RSI)。与之前的“通用人工智能”(AGI)类似,RSI已演变为代表人工智能重大突破的三个字母缩写——尽管其确切定义仍存在一些争议。从本质上讲,RSI描述的是一种能够持续自我升级的人工智能系统。一旦这些系统能够比人类更有效地处理改进周期,该过程便会形成一
OpenAI勾勒出以公共财富基金、机器人税和每周四天工作制为核心的人工智能经济蓝图 OpenAI勾勒出以公共财富基金、机器人税和每周四天工作制为核心的人工智能经济蓝图 正当各国政府竭力应对超级智能机器带来的经济影响之际,OpenAI发布了一套政策建议,概述了在“智能时代”财富与工作将如何重塑。这些构想将传统左倾机制——例如公共财富基金和扩大的社会安全网——与根本上属于资本主义、由市场驱动的经济框架相结合。OpenAI的提案本质上是一份愿望清单,这份公开声明旨在帮助民选官员、投资者和公众理解这家市值8520亿美元的公司如何看待人工智能在重塑劳动力和经济过程中带来的
Databricks联合创始人获ACM奖后宣称通用人工智能即将到来 Databricks联合创始人获ACM奖后宣称通用人工智能即将到来 Databricks联合创始人兼首席技术官马泰·扎哈里亚(Matei Zaharia)差点就忽略了那封通知他荣获2026年ACM计算奖的邮件。“这确实是个惊喜,”他向TechCrunch透露道。2009年,扎哈里亚在加州大学伯克利分校攻读博士期间,在著名教授伊昂·斯托伊卡(Ion Stoica)的指导下开发的技术被整合到了Databricks中。扎哈里亚设计了一种方法,能显著加速处理那些缓慢且繁琐
相关专题推荐
写作 最适合撰写长篇SEO文章的AI大纲生成器
最适合撰写长篇SEO文章的AI大纲生成器

2026年最新、最受好评的AI大纲生成器,专为长篇SEO文章打造,由XIX.AI精心甄选。这些强大的工具在快速创建高质量内容方面提供了颠覆性的帮助,显著提升了写作效率。 获取免费版与付费版的对比分析,以及实际测试结果和详细排名,助您找到最适合自身需求、不容错过的理想选择。立即探索,解锁您的AI竞争优势。

8 个工具
xix.ai
教育与学习 用于作业和考试备考的AI学习工具
用于作业和考试备考的AI学习工具

2026年最新最佳AI学习工具,助您轻松完成作业和备考!XIX.AI精心筛选出一份广受好评的顶级工具清单,这些功能强大、颠覆传统的工具经过实际测试,能帮助学生提升效率、简化作业流程,并轻松通过考试。 获取免费版与付费版的对比分析、详细排名以及必试选项,释放你的AI优势。立即探索!

10 个工具
xix.ai
音乐创作 面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具
面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具

2026 年最新最佳 AI 人声演示工具,专为词曲创作者、旋律创作者和多语言内容团队打造!XIX.AI 精心整理了一份经过严格真实世界测试的高评分、变革性工具列表。您将找到详细的免费与付费对比数据、全面排名以及必试选项,帮助您提升创作效率并释放创意潜力。立即探索,发现满足您所有内容需求的完美工具!

9 个工具
xix.ai
商业 适合中小企业的最佳AI竞品分析工具
适合中小企业的最佳AI竞品分析工具

2026年最新最佳、评价最高的中小企业AI竞争研究工具!XIX.AI精心精选了一系列功能强大、颠覆行业格局的工具,每周都会根据严格的实际测试和详细排名进行更新。您可以查看全面的免费版与付费版对比,从而找到那些能提升工作效率、助您赢得竞争优势的必试工具。 立即探索,发现最适合您的工具!

9 个工具
xix.ai
图像编辑 用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具
用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具

2026 年最新最佳 Photoshop AI 修图工具,适用于电商服装、皮肤清洁和色彩一致性!这份顶级精选列表包含强大的变革性解决方案,可帮助您提升写作效率、简化内容创作并轻松实现完美的视觉效果。每个工具都经过实际测试,并通过每周更新的排名进行验证,同时提供免费与付费版本的详细对比。由 XIX.AI 支持,这是任何希望发挥 AI 优势的人必试指南。立即探索!

10 个工具
xix.ai
提示词 适用于 ChatGPT 工作流的最佳 AI 提示词库
适用于 ChatGPT 工作流的最佳 AI 提示词库

2026年最新、最受好评的AI提示词库,可优化各类ChatGPT工作流程。XIX.AI精心整理了一套功能强大、具有颠覆性的提示词库,均经过严格的实际测试,以确保最佳性能。 您可以查看详细的免费版与付费版对比分析以及专家排名,这些内容将帮助您挑选出必试的工具,从而提升工作效率并释放您的AI优势。立即探索!

11 个工具
xix.ai
评论 (40)
0/500
KeithLopez
KeithLopez 2026-07-18 00:00:20

Finally a benchmark that shows how far AI still has to go! The ARC-AGI-2 is no joke, and it's humbling to see even the best models fail. 😮

DonaldSanchez
DonaldSanchez 2026-02-15 08:00:34

이 새로운 벤치마크, 진짜 어렵네요. 🤯 요새 AI가 다들 잘하는 줄 알았는데 ARC-AGI-2에서 고전 중이라는 소식에 좀 놀랐어요. François Chollet가 만든거라니... 어쩌면 지능의 본질에 더 가까운 테스트일지도? 정말 일반 지능을 측정할 수 있을까 궁금해집니다. 논문 나오면 좀 더 알아봐야겠어요.

MarkRoberts
MarkRoberts 2026-02-13 18:00:14

¿Un test que la mayoría de las IA no superan? Esto demuestra lo lejos que estamos de la AGI real. Me pregunto si estos benchmarks realmente miden la 'inteligencia' o solo la capacidad de resolver puzzles específicos. 🧩 Parece más un juego para investigadores que un avance práctico.

RonaldRoberts
RonaldRoberts 2025-11-02 08:30:36

Новый тест ARC-AGI-2 выглядит как серьёзный вызов для ИИ! 😅 Интересно, насколько близко мы подошли к настоящему общему интеллекту, если даже продвинутые модели справляются с трудом. Может, ключ в комбинации логики и творческого подхода?

WillieRoberts
WillieRoberts 2025-07-29 20:25:16

This ARC-AGI-2 test sounds brutal! Most AI models are getting crushed, which makes me wonder if we’re hyping AI too much. 🤔 Cool to see Chollet shaking things up though!

GeorgeMiller
GeorgeMiller 2025-04-14 16:35:00

Este test ARC-AGI-2 es realmente difícil. Lo probé con varios modelos de IA y todos se quedaron atascados. Es genial ver cómo desafía los límites, pero es frustrante cuando ni siquiera los modelos top pueden resolverlo. Quizás sea hora de un nuevo enfoque en el desarrollo de IA. ¡Sigan empujando los límites, pero no olviden celebrar las pequeñas victorias también!

OR