François Chollet 称 GPT-6 Astra 在交互式推理上实现“阶梯式”飞跃
英文标题:François Chollet (@fchollet) on X
François Chollet 宣布 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 测试中得分 66%,连续对话模式下接近满分,标志着模型智能的重大突破。
为什么值得关注
这项突破意味着 AI 在需要实时推理和交互的任务上(如游戏、复杂问题解决)可能超越人类效率,同时成本高昂(每局 360 美元)限制了普及。但更重要的是,模型开始自发进行符号化建模,这可能是通往通用人工智能(AGI)的关键一步,未来 AI 将能更灵活地适应新环境,而无需依赖外部框架。
核心要点
- GPT-6 Astra 在 ARC-AGI-3 标准测试中得分 66%,连续对话模式下接近 100%。
- 连续对话版本在几乎所有关卡中的行动效率超过人类基准。
- Astra 能实时进行符号化世界建模,并发展出针对特定游戏的 DSL。
- Chollet 认为这是模型智能的重大突破,框架能力正转移到模型本身。
- 每局游戏成本约 360 美元,目前成本较高。
GPT-6 Astra 代表了模型在交互式推理问题上的能力出现了“阶梯式”飞跃。在我们标准的测试框架下,它在 ARC-AGI-3 上得分 66%;而如果使用连续对话框架并配合自定义压缩,得分几乎能达到 100%,不过每局游戏的成本大约是 360 美元。
实际上,使用连续对话框架的版本,在几乎所有关卡中的行动效率都明显超过了我们的人类基准水平。当我们检查推理链条来理解模型的运作方式时,我们发现它会在每个游戏和关卡中,实时进行非常高效的符号化世界建模。它甚至会发展出自己的速记式领域特定语言(DSL,即一种专门用来描述特定场景的小型编程语言)来表示游戏内的状态——本质上就是一种针对特定游戏的代数符号系统。
总的来说,Astra 展现出的符号化建模行为,我们以前只有在复杂的框架辅助下才能看到——所以,框架的能力正在越来越多地转移到模型本身之中。
我们认为 Astra 是模型智能领域的一项重大突破。
阅读我们关于 Astra 以及这些结果意义的文章:arcprize.org/blog/astra OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上的表现 | ARC Prize 来自 arcprize.org
术语表
- ARC-AGI-3
- 一种用于评估 AI 通用智能的基准测试,强调抽象推理和适应新任务的能力。
- 连续对话框架
- 一种允许 AI 在多轮对话中持续推理和交互的测试环境,模拟真实场景。
- 符号化世界建模
- 将环境状态抽象为符号或规则进行推理,类似于人类用语言或数学描述世界。
- DSL(领域特定语言)
- 为特定领域设计的小型编程语言,此处指模型为游戏状态创建的速记符号系统。
生产区
使用这篇文章
复制包含 frontmatter、中文正文和英文来源的 Markdown。
我的研究区
记录自己的判断,不会写回原文或公开页面。
一句话说清这篇材料能支撑什么角度。
每行一个,最多 20 个。
支持 Markdown。要核对的数据、可复用的方法、反方观点或补充来源。