Signal Desk
X:Artificial Analysis (@ArtificialAnlys)AI 中文译文 · 待人工复核

GPT-6 Astra 发布:编程能力追平顶级模型,但价格翻倍

英文标题:Artificial Analysis (@ArtificialAnlys) on X

OpenAI 发布 GPT-6 Astra,在编程智能体指数中以更低成本追平 Fable 5,但智能指数中因价格翻倍而性价比下降。

正文研究价值 44 / 100

英文原文我的研究区

为什么值得关注

GPT-6 Astra 的发布标志着 AI 模型在编程和智能任务上的竞争进入新阶段。对于普通用户而言,模型性能提升可能带来更智能的助手,但价格翻倍意味着使用成本增加。同时,token 效率的提升可能降低长期使用成本,但当前定价策略让消费者难以直接受益。

核心要点

  1. GPT-6 Astra 在编程智能体指数中得分 67,与顶级模型持平,成本仅为 Fable 5 的一半。
  2. 在智能指数中,GPT-6 Astra 得分 61,与 GPT-5.6 Sol 持平,但价格高出 2.5 倍。
  3. 编程任务中 token 使用量比 GPT-5.6 Sol 减少 70%,但价格翻倍抵消了成本优势。
  4. 幻觉率从 92% 降至 51%,同时准确性提升 4 个百分点。
  5. 在长周期知识工作评估 AA-Briefcase 中提升约 80 分,但在部分基准测试中得分下降。

Artificial Analysis@ArtificialAnlys GPT-6 Astra 在 Artificial Analysis 编程智能体指数中取得显著进步,以更低的成本获得了与 Fable 5 相同的得分。在智能指数中,它比 GPT-5.6 Sol 使用更少的 token(即模型处理文本时使用的最小单位)就能达到相似性能,但这被更高的价格所抵消。

定价全面是 GPT-5.6 Sol 当前价格的 2.5 倍,从每百万输入/输出 token 的 $4/$20 上涨到 $10/$50,缓存读取仍享受 90% 折扣,缓存写入则有 25% 的溢价。

在我们两个旗舰指数中,我们看到了不同的情况。在 Artificial Analysis 编程智能体指数中,GPT-6 Astra 以不到一半的成本追平 Fable 5,这得益于显著的 token 效率提升。在 Artificial Analysis 智能指数中,GPT-6 Astra 在相似性能下比其前代产品更节省 token,但这被价格上涨所抵消。

Artificial Analysis 编程智能体指数 - 关键要点:

媲美顶级模型:在 Codex 环境中,GPT-6 Astra 在指数中得分 67——与 Claude Code 中的 Claude Opus 5 和 Fable 5,以及 Muse Code 中的 Muse Spark 1.3 大致相当。Claude Code 中的 Fable 5.1 以 70 分领跑该指数。

比 GPT-5.6 Sol 节省 70% 的 token:GPT-6 Astra 在 token 效率上有大幅提升,在 Codex 测试环境中使用的 token 仅为 GPT-5.6 Sol(最高努力模式)的三分之一,是 Claude Opus 5(xhigh)的五分之一。该模型的不同努力级别占据了 token 效率的帕累托前沿(即在效率上无法被同时超越的最优组合点)。

领跑编程智能体指数成本效率前沿:在最高努力模式下,GPT-6 Astra 的成本与 GPT-5.6 Sol(最高努力模式)大致相同,但指数得分高出 2 分。每项任务,该模型的成本不到 Claude Fable 5 的一半,却获得相同得分。

Artificial Analysis 智能指数 - 关键要点:

智能水平与 GPT-5.6 Sol 相当:GPT-6 Astra 在指数中得分 61,与 GPT-5.6 Sol 持平。这比 Claude Fable 5.1(带回退的最高努力模式)低 5 分。该模型也落后于 Meta 新发布的 Muse Spark 1.3(最高努力模式)。

输出 token 减少约 10%,但被价格上涨抵消:GPT-6 Astra 在智能指数与每任务输出 token 方面定义了新的帕累托前沿——在最高努力模式下,token 使用量比 GPT-5.6 Sol 减少约 10%。然而,由于价格上涨 2.5 倍,该模型在最高努力模式下每项任务的成本比其前代高出 75%。

幻觉率比 GPT-5.6 Sol 减少一半:GPT-6 Astra 在我们的知识与幻觉基准测试 AA-Omniscience 中取得了大幅进步。这得益于幻觉率从最高努力模式下的 92% 显著下降到 51%。与某些模型不同,这一改进并未以牺牲准确性为代价——Astra 同时将准确性提升了 4 个百分点。

AA-Briefcase Elo 提升约 80 分:GPT-6 Astra 在我们的前沿长周期知识工作评估 AA-Briefcase 中提升了约 80 分。模型需要接受为期数周的项目测试,其中包含许多关联任务和数千个源文件。与前代相比,Astra 在 AA-Briefcase 中的评分标准和分析质量 Elo 均有显著提升。另一方面,我们观察到演示质量 Elo 有所下降,GPT-5.6 Sol(最高努力模式)在此项上仍领先所有模型。

其他评估进展不一:该模型在 Humanity's Last Exam(一项长期评估,侧重于数学、科学和人文学科)中提升了 6 分。但这被 GDPval-AA v2 中约 80 个 Elo 分的下降所抵消——这是我们根据 OpenAI 数据集改编的基准测试,衡量 44 个职业中具有经济价值的任务。我们还在其他多项能力评估中观察到 2-3 分的退步,包括 τ³-Banking(客户服务)、SciCode(科学领域的 Python 问题)和 AA-LCR(大型文档上的长上下文推理)的得分下降。

祝贺 @OpenAI@sama 发布新模型!

下午 7:31 · 2026 年 9 月 3 日 55.5K 次查看 94

术语表

token
模型处理文本时使用的最小单位,可以是一个单词、子词或字符。
帕累托前沿
在多个目标(如效率和成本)之间无法同时改进的最优组合点。
幻觉率
模型生成不真实或错误信息的概率。
Elo
一种用于衡量模型相对能力的评分系统,常用于棋类或竞技游戏。

生产区

使用这篇文章

复制包含 frontmatter、中文正文和英文来源的 Markdown。

我的研究区

记录自己的判断,不会写回原文或公开页面。

一句话说清这篇材料能支撑什么角度。

每行一个,最多 20 个。

支持 Markdown。要核对的数据、可复用的方法、反方观点或补充来源。