Signal Desk
The Decoder:AI News(RSS)AI 中文译文 · 待人工复核

基准测试对 GPT-6 Astra 看法不一,但其在 ARC-AGI-3 上超越人类效率的表现,让 Chollet 提前了 AGI 预测

英文标题:Benchmarks disagree on GPT-6 Astra, but its human-beating efficiency on ARC-AGI

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准测试中以 62.7% 的得分超越人类平均效率,促使 ARC Prize 负责人 François Chollet 将其 AGI 预测提前。

正文研究价值 82 / 100

英文原文我的研究区

为什么值得关注

GPT-6 Astra 在 ARC-AGI-3 上的表现表明,AI 在适应新环境和高效学习方面已接近甚至超越人类水平。这不仅挑战了此前关于 AI 局限性的认知,也可能加速 AGI 的到来,影响就业、经济和社会结构。同时,不同基准测试的结论差异凸显了评估 AI 能力的复杂性,需要更全面的评价标准。

核心要点

  1. GPT-6 Astra 在 ARC-AGI-3 上达到 62.7%,超越人类平均效率,而前代 Sol 仅 7.78%。
  2. Epoch AI 将 Astra 排第一,但 Artificial Analysis 认为其与前代持平,凸显基准测试分歧。
  3. Astra 在 ARC-AGI-3 中自创符号系统,以少于人类中位数的步数解决 96% 的关卡。
  4. François Chollet 称进展比预期快两倍,并提前了 AGI 预测。
  5. Astra 的思考强度与成本呈反比,更高推理级别反而降低测试成本。
  6. ARC Prize 强调这并非 AGI 证据,但下一代基准测试 ARC-AGI-4 计划于 2027 年发布。

OpenAI 的 GPT-6 Astra 引发了相互矛盾的基准测试结论。Epoch AI 将其排在领先位置,而 Artificial Analysis 则认为它并不比前代产品更好。最大的惊喜来自 ARC-AGI-3,Astra 首次以高于普通人类的效率完成测试。ARC Prize 负责人 François Chollet 称这一进展比他预期的“快了两倍”,并提前了他的 AGI 预测。

两家独立实验室各自将数十项单独测试汇总成一个综合得分,却得出了相反的结论。Epoch AI 综合了 50 多项基准测试,将 GPT-6 Astra 以 169 分明显排在首位,领先于 267 个模型。Artificial Analysis 测试了知识、编码和文本理解能力,将 GPT-6 Astra 评为 61 分,与其前代产品完全持平,落后于 Claude Fable 5.1 的 66 分。

Astra 明显比自己的前代产品更贵。OpenAI 对每单位处理文本的收费是前者的两倍半,这使得完成一项任务的成本比 Sol 高出约 75%。但与 Anthropic 相比,情况则相反。在编码任务上,根据 Artificial Analysis 的数据,Astra 的得分与 Claude Fable 5 相同,但每项任务的成本不到后者的一半。原因在于该模型非常节省。它只需要 Sol 所用计算步骤的三分之一,以及 Opus 5 所用步骤的五分之一。

*GPT-6 Astra 在 xhigh 推理强度下的表现;在最高强度下达到 97.5%。ARC-AGI-1 现在被认为已基本饱和。

在编码代理指数上,它以约 Sol 三分之一的 token 使用量达到 67 分,而 Fable 5.1 以 70 分领先。AA-Omniscience 上的幻觉率从 92% 下降到 51%。与此同时,该模型在 GDPval-AA v2 上损失了约 80 个 Elo 积分,并在银行支持、SciCode 和长上下文推理任务上有所下滑。

Epoch AI 报告称,在新的 FrontierMath Erdős 上,GPT-6 Astra 是唯一一个在每次尝试预算 300 美元的情况下,用 Lean 验证证明解决了 68 个开放 Erdős 问题中两个的模型。另外三个解决方案来自非标准化的额外运行,消耗了超过 22 万美元的计算资源,但 Epoch 表示这些不计入得分。

仔细查看 Epoch 的单项数据可以发现,GPT-6 Astra 和竞争对手 Fable 5.1 迄今为止是在不同的测试条件下被评估的。Astra 在数学、知识和谜题方面领先。Fable 5.1 在几乎所有编码测试中都保持最高分。但 Epoch 目前只记录了 Astra 的一个编码得分,而且该得分来自中等推理水平的运行。

ARC-AGI-3 显示出巨大飞跃

最明显的飞跃出现在 ARC-AGI-3 上。该测试将 AI 投入到陌生的游戏世界中,没有人向它解释规则和目标。模型必须通过反复试错来弄清楚该怎么做。GPT-6 Astra 以约 26,000 美元的测试成本达到 62.7%。其前代 GPT-5.6 Sol 达到了 7.78%,竞争对手 Claude Opus 5 达到了 30.16%。Fable 5 和 Fable 5.1 尚未出现在该基准测试中。

OpenAI 报告的 99.9% 是在不同条件下取得的。在该设置中,Astra 可以使用 OpenAI 构建的 harness(一种辅助框架),它能在各个请求之间保留推理链,并自动总结长时间运行的过程。根据 ARC Prize 的测量,与在内部 harness 上的运行相比,这些运行速度大约快 3.66 倍,token 使用量少 49%,这是在两种设置都解决的 167 个游戏推理对中比较得出的。

这些 harness 的使用以及随之而来的性能提升,已经是 ARC Prize 和 OpenAI 之间 在 GPT-5.6 Sol 时期 的一个争议点。ARC Prize 指出,只有在内部 ARC harness 上运行的较低数字 62.7% 才允许在不同供应商之间进行公平比较,不过它计划将来也公布供应商 harness 的数据。

在这里,思考越多,账单越低

思考强度与成本之间的关系很不寻常。通常,更高的推理级别会使测试运行更昂贵。但 Astra 恰恰相反。在标准 ARC 框架上,成本从无推理时的 49,791 美元下降到最大推理时的 26,098 美元,而得分从 35.2% 攀升到 62.7%。根据 ARC Prize 的说法,原因是 Astra 用更少的步骤解决了游戏,这意味着更少的模型调用和更少的 token。有一个奇怪的现象值得注意:“低”级别的得分为 17.5%,比完全不推理还要差。ARC Prize 没有对这个异常值发表评论,但 GPT-6 Astra 在其他基准测试中表明,由于其新架构,它可以在不进行推理的情况下解决更长周期的任务,该架构可能 在生成第一个 token 之前在内部循环处理信息

作为对比,人类测试者每 90 分钟 session 获得 115 美元,外加每解决一个游戏 5 美元,因此按大约九次尝试计算,每个游戏约合 12.78 美元。但这主要是为时间和参与意愿付费。如果只把大脑的代谢能量算作电力,ARC Prize 得出的结果是每个游戏 0.067 美分。

比原始分数更有趣的是效率。在发布之前,ARC Prize 让约 500 名测试者在不进行预筛选的情况下进行游戏,并记录了每个级别中成功解决者的步数中位数。在使用 OpenAI 框架的运行中,Astra 以少于该中位数的步数通过了 96% 的级别,平均步数略多于中位数的一半。与通常的成本衡量不同,这个数字不追踪消耗的计算量。它追踪的是模型在掌握一个环境之前需要多少与该环境互动的经验。

这正是组织者原本预计人类会保持持久优势的地方。对于蛮力方法来说仍然如此,但对于顶级模型,ARC Prize 看到了一种近乎二元的模式。一旦模型弄清楚了机制,它的执行就落入了人类的效率范围。

Astra 发明了自己的符号系统

为了达到这一目标,Astra 会保留自己的笔记,并开发出一种自创的、类似代数的速记法,用来记录对象、坐标、规则和未完成的计划,例如将 extend8 to3; retract10 to2 作为有序的移动序列,或将 Turn 5: P=(24,20), empty, facing west 作为状态笔记。ARC Prize 在其他模型中也看到了类似的行为,但特别指出 Astra 的精确性和信息密度。在标准 harness 上,这是一项重要技能,因为模型没有保存到自己的可见笔记中的一切都会丢失。

ARC 联合创始人 François Chollet 在 X 上 将其描述为“针对每个游戏和级别的高效、即时符号世界建模”。该模型甚至“开发出自己的速记 DSL(一种小型专用语言)来表示游戏内情境”,其核心“本质上是一种特定于游戏的代数符号”。对 Chollet 来说,最重要的是这种行为的来源:“Astra 表现出的符号建模行为,我们以前只在复杂的 harness 中看到过,因此 harness 的能力正越来越多地转移到模型本身。”

Astra 创建了一个密集、紧凑的符号世界模型来完成 ARC-AGI-3 环境。 例如,在环境 s5i5 中,Astra:

  • 记录了当前级别、中心方向舵的朝向和机制长度:“L8: hub q2 (8↓). Lengths: 14=1…”
  • 它将操作映射到精确的控制上:… pic.twitter.com/tMHP002mkB — ARC Prize (@arcprize) 2026年9月3日

第三个测试环境展示了 Astra 在外部工具辅助下的能力。PRO-LONG 是一个由第三方开发的代理框架,ARC Prize 团队早期将其部署为 ARC-AGI-3 的红队合作伙伴——也就是说,用来系统地探索基准测试的极限。与标准设置不同,模型被提供了一个沙箱环境,可以在其中执行自己的代码。

Astra 利用了这一点,为每个游戏编写了小型程序库:游戏板的解析器、状态模型、搜索算法和规划器。在一个有守卫的迷宫游戏中,它依次开发了寻路器、战斗规则模块、巡逻移动模型,以及一个不断将自己的预测与观察结果进行比较的脚本。ARC Prize 没有观察到任何试图逃离沙箱的行为。这些运行与人类测试条件不可比,因为测试对象既没有代码解释器也没有记事本。这里衡量的是模型与自建工具的综合表现。

Chollet:不是 AGI 的证据,但比预期更快

ARC Prize 明确表示不将这些结果解释为通用人工智能的证据。“我们目前对该系统所知的只是它的基准测试分数,”Chollet 写道。在 ARC-AGI-3 发布时,他们在每次演示中都强调了一点:“解决它并不是 AGI 的证据。它不打算被视为终点线。”虽然该基准测试确实检验了 AGI 系统应具备的正确定性属性——即不确定性下的探索、无指导的适应能力,以及从稀疏数据中进行因果世界建模——但它是在“小规模”上进行的。游戏运行的时间尺度比现实世界任务短几个数量级,因此需要更少的数据、更少的建模复杂性和更少的即时学习。

大约六个月前 ARC-AGI-3 发布时,Chollet 在回答关于饱和时间的问题时曾表示“大约一年”,具体取决于对基准测试的专注程度。因此,Astra 的到来比他预期的“快了两倍”。“我相信进步的节奏会让很多人感到惊讶,新模型的能力将挑战人们基于早期模型形成的对 AI 的认知。”当一位用户问他早先对 2030 年的 AGI 预测是否仍然成立时,Chollet 简洁地回答说:“会更早,因为进展比我预期的要快。”

这个结果又是一个基准测试。据 Chollet 称,ARC-AGI-4 自 ARC-AGI-3 发布以来一直在开发中,计划于 2027 年第一季度发布。基准测试是一个持续的过程,随着模型的发展而演变,并且始终瞄准 AI 与人类智能之间剩余的差距。该组织认为 ARC-AGI-3 本身相当有限:确定性机制、封闭式目标,并且不表征开放的现实世界。下一代计划探索递归自我改进和开放式创新等领域。

无炒作 AI 新闻——人工精选

订阅 THE DECODER,享受无广告阅读、每周 AI 通讯、每年六次的独家“AI Radar”前沿报告、完整档案访问权限以及评论区的访问权限。

继续阅读以了解全貌。订阅以获得无炒作报道。

  • 完整访问 THE DECODER 上的每篇文章

  • 无广告

  • 参与评论和社区讨论

  • 每周通过邮件发送 AI 新闻摘要

  • 每年 6 次:“AI Radar”——深入探讨最重要的 AI 话题

  • 每日 AI 新闻,始终更新

  • 我们完整的十年档案

  • 由拥有 10 年以上 AI 经验的团队撰写

术语表

ARC-AGI-3
一种基准测试,将 AI 置于陌生游戏世界中,要求其通过试错理解规则并解决问题,旨在衡量适应性和因果建模能力。
AGI
通用人工智能,指具备与人类相当或超越人类的广泛认知能力,能执行任何智力任务的 AI。
基准测试
用于评估 AI 模型性能的标准测试集,通过统一任务比较不同模型的能力。
推理强度
模型在生成答案前进行内部思考或计算的程度,通常影响输出质量和成本。
harness
辅助框架或工具,帮助 AI 在任务中保留信息、组织推理,提升性能。
符号系统
模型自创的抽象表示方法,如代数符号,用于高效记录和操作环境信息。
Elo 积分
一种用于衡量玩家或 AI 相对实力的评分系统,常用于棋类或竞技游戏。
token
文本处理中的基本单位,可以是单词或子词,模型通过处理 token 来理解和生成语言。

生产区

使用这篇文章

复制包含 frontmatter、中文正文和英文来源的 Markdown。

我的研究区

记录自己的判断,不会写回原文或公开页面。

一句话说清这篇材料能支撑什么角度。

每行一个,最多 20 个。

支持 Markdown。要核对的数据、可复用的方法、反方观点或补充来源。