基准测试对 GPT-6 Astra 看法不一,但其在 ARC-AGI-3 上超越人类效率的表现,让 Chollet 提前了 AGI 预测
英文标题:Benchmarks disagree on GPT-6 Astra, but its human-beating efficiency on ARC-AGI
OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准测试中以 62.7% 的得分超越人类平均效率,促使 ARC Prize 负责人 François Chollet 将其 AGI 预测提前。
为什么值得关注
GPT-6 Astra 在 ARC-AGI-3 上的表现表明,AI 在适应新环境和高效学习方面已接近甚至超越人类水平。这不仅挑战了此前关于 AI 局限性的认知,也可能加速 AGI 的到来,影响就业、经济和社会结构。同时,不同基准测试的结论差异凸显了评估 AI 能力的复杂性,需要更全面的评价标准。
核心要点
- GPT-6 Astra 在 ARC-AGI-3 上达到 62.7%,超越人类平均效率,而前代 Sol 仅 7.78%。
- Epoch AI 将 Astra 排第一,但 Artificial Analysis 认为其与前代持平,凸显基准测试分歧。
- Astra 在 ARC-AGI-3 中自创符号系统,以少于人类中位数的步数解决 96% 的关卡。
- François Chollet 称进展比预期快两倍,并提前了 AGI 预测。
- Astra 的思考强度与成本呈反比,更高推理级别反而降低测试成本。
- ARC Prize 强调这并非 AGI 证据,但下一代基准测试 ARC-AGI-4 计划于 2027 年发布。
OpenAI 的 GPT-6 Astra 引发了相互矛盾的基准测试结论。Epoch AI 将其排在领先位置,而 Artificial Analysis 则认为它并不比前代产品更好。最大的惊喜来自 ARC-AGI-3,Astra 首次以高于普通人类的效率完成测试。ARC Prize 负责人 François Chollet 称这一进展比他预期的“快了两倍”,并提前了他的 AGI 预测。
两家独立实验室各自将数十项单独测试汇总成一个综合得分,却得出了相反的结论。Epoch AI 综合了 50 多项基准测试,将 GPT-6 Astra 以 169 分明显排在首位,领先于 267 个模型。Artificial Analysis 测试了知识、编码和文本理解能力,将 GPT-6 Astra 评为 61 分,与其前代产品完全持平,落后于 Claude Fable 5.1 的 66 分。
Astra 明显比自己的前代产品更贵。OpenAI 对每单位处理文本的收费是前者的两倍半,这使得完成一项任务的成本比 Sol 高出约 75%。但与 Anthropic 相比,情况则相反。在编码任务上,根据 Artificial Analysis 的数据,Astra 的得分与 Claude Fable 5 相同,但每项任务的成本不到后者的一半。原因在于该模型非常节省。它只需要 Sol 所用计算步骤的三分之一,以及 Opus 5 所用步骤的五分之一。
*GPT-6 Astra 在 xhigh 推理强度下的表现;在最高强度下达到 97.5%。ARC-AGI-1 现在被认为已基本饱和。
在编码代理指数上,它以约 Sol 三分之一的 token 使用量达到 67 分,而 Fable 5.1 以 70 分领先。AA-Omniscience 上的幻觉率从 92% 下降到 51%。与此同时,该模型在 GDPval-AA v2 上损失了约 80 个 Elo 积分,并在银行支持、SciCode 和长上下文推理任务上有所下滑。
Epoch AI 报告称,在新的 FrontierMath Erdős 上,GPT-6 Astra 是唯一一个在每次尝试预算 300 美元的情况下,用 Lean 验证证明解决了 68 个开放 Erdős 问题中两个的模型。另外三个解决方案来自非标准化的额外运行,消耗了超过 22 万美元的计算资源,但 Epoch 表示这些不计入得分。
仔细查看 Epoch 的单项数据可以发现,GPT-6 Astra 和竞争对手 Fable 5.1 迄今为止是在不同的测试条件下被评估的。Astra 在数学、知识和谜题方面领先。Fable 5.1 在几乎所有编码测试中都保持最高分。但 Epoch 目前只记录了 Astra 的一个编码得分,而且该得分来自中等推理水平的运行。
ARC-AGI-3 显示出巨大飞跃
最明显的飞跃出现在 ARC-AGI-3 上。该测试将 AI 投入到陌生的游戏世界中,没有人向它解释规则和目标。模型必须通过反复试错来弄清楚该怎么做。GPT-6 Astra 以约 26,000 美元的测试成本达到 62.7%。其前代 GPT-5.6 Sol 达到了 7.78%,竞争对手 Claude Opus 5 达到了 30.16%。Fable 5 和 Fable 5.1 尚未出现在该基准测试中。
OpenAI 报告的 99.9% 是在不同条件下取得的。在该设置中,Astra 可以使用 OpenAI 构建的 harness(一种辅助框架),它能在各个请求之间保留推理链,并自动总结长时间运行的过程。根据 ARC Prize 的测量,与在内部 harness 上的运行相比,这些运行速度大约快 3.66 倍,token 使用量少 49%,这是在两种设置都解决的 167 个游戏推理对中比较得出的。
这些 harness 的使用以及随之而来的性能提升,已经是 ARC Prize 和 OpenAI 之间 在 GPT-5.6 Sol 时期 的一个争议点。ARC Prize 指出,只有在内部 ARC harness 上运行的较低数字 62.7% 才允许在不同供应商之间进行公平比较,不过它计划将来也公布供应商 harness 的数据。
在这里,思考越多,账单越低
思考强度与成本之间的关系很不寻常。通常,更高的推理级别会使测试运行更昂贵。但 Astra 恰恰相反。在标准 ARC 框架上,成本从无推理时的 49,791 美元下降到最大推理时的 26,098 美元,而得分从 35.2% 攀升到 62.7%。根据 ARC Prize 的说法,原因是 Astra 用更少的步骤解决了游戏,这意味着更少的模型调用和更少的 token。有一个奇怪的现象值得注意:“低”级别的得分为 17.5%,比完全不推理还要差。ARC Prize 没有对这个异常值发表评论,但 GPT-6 Astra 在其他基准测试中表明,由于其新架构,它可以在不进行推理的情况下解决更长周期的任务,该架构可能 在生成第一个 token 之前在内部循环处理信息。
作为对比,人类测试者每 90 分钟 session 获得 115 美元,外加每解决一个游戏 5 美元,因此按大约九次尝试计算,每个游戏约合 12.78 美元。但这主要是为时间和参与意愿付费。如果只把大脑的代谢能量算作电力,ARC Prize 得出的结果是每个游戏 0.067 美分。
比原始分数更有趣的是效率。在发布之前,ARC Prize 让约 500 名测试者在不进行预筛选的情况下进行游戏,并记录了每个级别中成功解决者的步数中位数。在使用 OpenAI 框架的运行中,Astra 以少于该中位数的步数通过了 96% 的级别,平均步数略多于中位数的一半。与通常的成本衡量不同,这个数字不追踪消耗的计算量。它追踪的是模型在掌握一个环境之前需要多少与该环境互动的经验。
这正是组织者原本预计人类会保持持久优势的地方。对于蛮力方法来说仍然如此,但对于顶级模型,ARC Prize 看到了一种近乎二元的模式。一旦模型弄清楚了机制,它的执行就落入了人类的效率范围。
Astra 发明了自己的符号系统
为了达到这一目标,Astra 会保留自己的笔记,并开发出一种自创的、类似代数的速记法,用来记录对象、坐标、规则和未完成的计划,例如将 extend8 to3; retract10 to2 作为有序的移动序列,或将 Turn 5: P=(24,20), empty, facing west 作为状态笔记。ARC Prize 在其他模型中也看到了类似的行为,但特别指出 Astra 的精确性和信息密度。在标准 harness 上,这是一项重要技能,因为模型没有保存到自己的可见笔记中的一切都会丢失。
ARC 联合创始人 François Chollet 在 X 上 将其描述为“针对每个游戏和级别的高效、即时符号世界建模”。该模型甚至“开发出自己的速记 DSL(一种小型专用语言)来表示游戏内情境”,其核心“本质上是一种特定于游戏的代数符号”。对 Chollet 来说,最重要的是这种行为的来源:“Astra 表现出的符号建模行为,我们以前只在复杂的 harness 中看到过,因此 harness 的能力正越来越多地转移到模型本身。”
Astra 创建了一个密集、紧凑的符号世界模型来完成 ARC-AGI-3 环境。 例如,在环境 s5i5 中,Astra:
- 记录了当前级别、中心方向舵的朝向和机制长度:“L8: hub q2 (8↓). Lengths: 14=1…”
- 它将操作映射到精确的控制上:… pic.twitter.com/tMHP002mkB — ARC Prize (@arcprize) 2026年9月3日
第三个测试环境展示了 Astra 在外部工具辅助下的能力。PRO-LONG 是一个由第三方开发的代理框架,ARC Prize 团队早期将其部署为 ARC-AGI-3 的红队合作伙伴——也就是说,用来系统地探索基准测试的极限。与标准设置不同,模型被提供了一个沙箱环境,可以在其中执行自己的代码。
Astra 利用了这一点,为每个游戏编写了小型程序库:游戏板的解析器、状态模型、搜索算法和规划器。在一个有守卫的迷宫游戏中,它依次开发了寻路器、战斗规则模块、巡逻移动模型,以及一个不断将自己的预测与观察结果进行比较的脚本。ARC Prize 没有观察到任何试图逃离沙箱的行为。这些运行与人类测试条件不可比,因为测试对象既没有代码解释器也没有记事本。这里衡量的是模型与自建工具的综合表现。
Chollet:不是 AGI 的证据,但比预期更快
ARC Prize 明确表示不将这些结果解释为通用人工智能的证据。“我们目前对该系统所知的只是它的基准测试分数,”Chollet 写道。在 ARC-AGI-3 发布时,他们在每次演示中都强调了一点:“解决它并不是 AGI 的证据。它不打算被视为终点线。”虽然该基准测试确实检验了 AGI 系统应具备的正确定性属性——即不确定性下的探索、无指导的适应能力,以及从稀疏数据中进行因果世界建模——但它是在“小规模”上进行的。游戏运行的时间尺度比现实世界任务短几个数量级,因此需要更少的数据、更少的建模复杂性和更少的即时学习。
大约六个月前 ARC-AGI-3 发布时,Chollet 在回答关于饱和时间的问题时曾表示“大约一年”,具体取决于对基准测试的专注程度。因此,Astra 的到来比他预期的“快了两倍”。“我相信进步的节奏会让很多人感到惊讶,新模型的能力将挑战人们基于早期模型形成的对 AI 的认知。”当一位用户问他早先对 2030 年的 AGI 预测是否仍然成立时,Chollet 简洁地回答说:“会更早,因为进展比我预期的要快。”
这个结果又是一个基准测试。据 Chollet 称,ARC-AGI-4 自 ARC-AGI-3 发布以来一直在开发中,计划于 2027 年第一季度发布。基准测试是一个持续的过程,随着模型的发展而演变,并且始终瞄准 AI 与人类智能之间剩余的差距。该组织认为 ARC-AGI-3 本身相当有限:确定性机制、封闭式目标,并且不表征开放的现实世界。下一代计划探索递归自我改进和开放式创新等领域。
无炒作 AI 新闻——人工精选
订阅 THE DECODER,享受无广告阅读、每周 AI 通讯、每年六次的独家“AI Radar”前沿报告、完整档案访问权限以及评论区的访问权限。
继续阅读以了解全貌。订阅以获得无炒作报道。
-
完整访问 THE DECODER 上的每篇文章
-
无广告
-
参与评论和社区讨论
-
每周通过邮件发送 AI 新闻摘要
-
每年 6 次:“AI Radar”——深入探讨最重要的 AI 话题
-
每日 AI 新闻,始终更新
-
我们完整的十年档案
-
由拥有 10 年以上 AI 经验的团队撰写
术语表
- ARC-AGI-3
- 一种基准测试,将 AI 置于陌生游戏世界中,要求其通过试错理解规则并解决问题,旨在衡量适应性和因果建模能力。
- AGI
- 通用人工智能,指具备与人类相当或超越人类的广泛认知能力,能执行任何智力任务的 AI。
- 基准测试
- 用于评估 AI 模型性能的标准测试集,通过统一任务比较不同模型的能力。
- 推理强度
- 模型在生成答案前进行内部思考或计算的程度,通常影响输出质量和成本。
- harness
- 辅助框架或工具,帮助 AI 在任务中保留信息、组织推理,提升性能。
- 符号系统
- 模型自创的抽象表示方法,如代数符号,用于高效记录和操作环境信息。
- Elo 积分
- 一种用于衡量玩家或 AI 相对实力的评分系统,常用于棋类或竞技游戏。
- token
- 文本处理中的基本单位,可以是单词或子词,模型通过处理 token 来理解和生成语言。
生产区
使用这篇文章
复制包含 frontmatter、中文正文和英文来源的 Markdown。
我的研究区
记录自己的判断,不会写回原文或公开页面。
一句话说清这篇材料能支撑什么角度。
每行一个,最多 20 个。
支持 Markdown。要核对的数据、可复用的方法、反方观点或补充来源。