Claude Fable 5.1 登顶智能指数,缓存降价但任务成本仍高
英文标题:Artificial Analysis (@ArtificialAnlys) on X
Anthropic 最新模型 Claude Fable 5.1 在 Artificial Analysis 智能指数中排名第一,但尽管缓存读取价格降低 75%,每项任务的成本仍比 Fable 5 高出 20%。
为什么值得关注
Claude Fable 5.1 的发布标志着 AI 模型在智能水平上的又一次飞跃,其基准测试成绩刷新了多项纪录。然而,成本问题依然突出,即使缓存价格大幅下降,任务总成本仍因输出令牌消耗增加而上升。这对企业和开发者意味着,虽然模型更聪明,但实际使用成本可能更高,需要在性能与成本之间做出权衡。缓存降价对代理型工作负载尤其有利,可能推动更多长上下文应用。
核心要点
- Claude Fable 5.1 在 Artificial Analysis 智能指数上得分 66,排名第一,领先于其他模型。
- 缓存读取价格从每百万令牌 $1 降至 $0.25,降幅 75%,但每项任务成本仍比 Fable 5 高 20%。
- Fable 5.1 在 HLE、Terminal-Bench v2.1、SciCode 等基准测试中创下新高。
- 在代理型工作任务上,Fable 5.1 创下最高分,但与 Claude Opus 5 相比优势有限。
- 模型支持 100 万令牌上下文窗口,定价与 Fable 5 相同,但缓存命中价格大幅降低。
Artificial Analysis@ArtificialAnlys Claude Fable 5.1 在 Artificial Analysis 智能指数中排名第一,但尽管缓存读取价格降低了 75%,每项任务的成本仍比 Fable 5 高出 20%
我们支持 @AnthropicAI 对 Claude Fable 5.1 进行了预发布评估。在最大努力模式下,它在 Artificial Analysis 智能指数上得分 66,这是我们测量到的最高分数,领先于 Claude Opus 5(最大,63)、Claude Fable 5(最大,62)、GPT-5.6 Sol(最大,61)和 Grok 4.6(高,61)。我们使用 Anthropic 的“默认”服务器端回退机制评估了该模型,该机制会将安全标记的请求路由到 Claude Opus 4.8 或 Claude Opus 5;在智能指数评估中,回退机制处理了约 4% 的输出令牌。
关键要点
➤ 前沿智能,基准测试全面改进:Fable 5.1 在智能指数上比 Fable 5 高出 +4 分。在 HLE 上,Fable 5.1 得分 59.1%,超过了之前由 Claude Fable 5 创下的 55.5% 的最佳成绩。它在 Terminal-Bench v2.1(91.4%)和 SciCode(62.0%)上取得了我们见过的最高分,在 τ³-Banking 上比 Fable 5 高出 9 分
➤ 缓存读取价格降低 75%,但 Fable 5.1 每项任务的成本仍然更高:Anthropic 将缓存读取价格从每 100 万缓存输入令牌 $1 降至 $0.25,标准定价保持不变,为每 100 万输入/输出令牌 $10/$50。Fable 5.1(最大)每项智能指数任务成本为 $3.76,比 Fable 5(最大)高出 20%,因为它使用的输出令牌数量约为其 1.7 倍。缓存降价每项任务节省约 $1.40,主要集中在代理型评估中,这些评估中大部分输入令牌是缓存读取。在 xhigh 努力模式下,Fable 5.1 得分 65,每项任务成本 $2.72,比最大模式低 $1.04,但仍高于 Claude Opus 5(最大,63)的 $2.34
➤ Claude Fable 5.1 占据智能与每任务输出令牌帕累托前沿的高端:在智能指数上得分高于 GPT-5.6 Sol(中等)的每个模型变体,在智能和令牌使用方面都被 Fable 5.1 的某个努力级别匹配或超越
➤ 在代理型工作任务上得分最高,但与 Opus 5 基本持平:Fable 5.1 在我们测量的 GDPval-AA v2(1,853 Elo,比 Fable 5 高 +130)和 AA-Briefcase(1,694 Elo,比 Fable 5 高 +122)上创下最高分,这是我们针对代理型知识工作的评估。与 Claude Opus 5 相比,GDPval-AA v2 的领先优势在置信区间内,AA-Briefcase(1,685)基本持平,Fable 5.1 在分析质量和评分标准正确性上领先,但在演示方面落后
其他模型详情:
➤ 上下文窗口:100 万令牌,支持图像和文本输入,与 Anthropic 其他近期发布的产品一致
➤ 定价:Fable 5.1 保留了 Fable 5 的每百万令牌 $10/$50/$12.5 输入、输出和缓存写入价格,但缓存命中价格降至每百万令牌 $0.25,相对之前降低了 75%,这将大幅降低代理型工作负载的成本下午 8:12 · 2026 年 9 月 1 日51.7K 次查看34
术语表
- Artificial Analysis 智能指数
- 一个综合评估 AI 模型智能水平的指标,通过一系列基准测试得出分数,分数越高代表模型越智能。
- 缓存读取
- 在 AI 推理中,重复使用之前计算过的输入令牌,可以降低成本。缓存读取价格即每次读取缓存令牌的费用。
- 输出令牌
- 模型生成的文本单位,输出令牌数量越多,通常意味着模型生成的内容越长,成本也越高。
- 代理型工作任务
- 指 AI 模型作为代理执行实际任务,如处理文档、编写代码等,需要多步骤推理和工具使用。
- 帕累托前沿
- 在多个目标(如智能和成本)之间达到最优平衡的边界,表示无法在不牺牲一个目标的情况下改善另一个目标。
生产区
使用这篇文章
复制包含 frontmatter、中文正文和英文来源的 Markdown。
我的研究区
记录自己的判断,不会写回原文或公开页面。
一句话说清这篇材料能支撑什么角度。
每行一个,最多 20 个。
支持 Markdown。要核对的数据、可复用的方法、反方观点或补充来源。