刚刚,Anthropic 发布了 Fable 5.1 和 Mythos 5.1。

打开网易新闻 查看精彩图片

话不多说,直接看数据:

Fable 5.1 和 Mythos 5.1 benchmark 数据
打开网易新闻 查看精彩图片
Fable 5.1 和 Mythos 5.1 benchmark 数据

各项 benchmark,几乎全为第一,非常凶残!

Agentic 科研01

Terminal-Bench-Science 0.1 上,Fable 5.1 拿到了52.6%

作为参考,Fable 5 是 24.7%,Opus 5 是 29.0%,GPT-5.6 Sol 是 22.4%。

Fable 5.1 比自家的上一代翻了一倍之多,比 Opus 5 高出近一倍,是 GPT-5.6 Sol 的两倍以上。

差距大到,有点不像是同一代产品了……不叫 Fable 6 是担心又被拦着不让用吗?!

Agentic 编程02

Terminal-Bench 4.0 上,Fable 5.1 拿到了56%,Mythos 5.1 则可以到 61%。

Opus 5 是 52.3%,GPT-5.6 Sol 只有 37.3%。

CursorBench 3.2.0 上同样也是第一,73.4%

而 Fable 5 和 Opus 5 都在 70% 出头,GPT-5.6 Sol 是 67.2%。

知识工作与推理03

知识工作(GDPval-AA v2)上,Fable 5.1 拿到了1853分,Opus 5 紧随其后 1824,Fable 5 是 1723,GPT-5.6 Sol 垫底 1711。

Humanity's Last Exam 上,无工具60.9%,有工具65.0%,两项也都是最高。

Computer Use04

OSWorld 2.0 上,partial 得分77.9%,strict 得分41.7%,也都是两项最高。

Opus 5 分别是 75.4% 和 39.6%,Fable 5 是 72.9% 和 36.1%。

业务流程自动化05

AutomationBench 上,Fable 5.1 拿到了31.4%

这个数字看着不高,但第二名 Opus 5 呢?26.9%。Fable 5 只有 17.1%。

Fable 5.1 几乎是 Fable 5 的两倍,GPT-5.6 Sol 的 19.6% 则还不到它的三分之二。

业务流程自动化这项,也是各家模型普遍得分不高的领域,31.4% 算是断层领先了。

Preserved Thinking06

除了 benchmark 之外,Fable 5.1 还有一个重要的变化:Preserved Thinking,也就是对 thinking block 的防蒸馏保护。

打开网易新闻 查看精彩图片

之前有一种公开的蒸馏手法是:在多轮对话中,修改 thinking block 之前的系统提示词、工具和消息,让 Claude 把加密的推理过程解密并打印出来。拿着这些推理数据去训练其他模型,就能在不经授权的情况下复制 Claude 的能力。

Fable 5.1 的做法上,API 会校验 thinking block 是否在原始上下文中返回。如果系统提示词、工具或之前的消息被改动了,请求就会直接报错。

开发者也可以选择 non-strict 模式,这种情况下不会报错,但被修改上下文的 thinking block 会被丢弃,缺点是模型看不到之前的推理过程。

目前这项限制只针对 2026 年 8 月 31 日之后新创建的 API 账号。老账号暂时不受影响(给你留了迁移时间),但 Anthropic 表示,未来的模型会全面执行。

Claude Code、Claude Cowork、claude.ai 的用户则完全不受影响。

价格上,维持不变:

打开网易新闻 查看精彩图片

好了,蹬起来吧!

蹬起来吧
打开网易新闻 查看精彩图片
蹬起来吧

Anthropic 官方博客:https://www.anthropic.com/research/fable-5-1

Preserved Thinking 文档:https://platform.claude.com/docs/en/build-with-claude/preserved-thinking

Fable 5.1 迁移指南:https://platform.claude.com/docs/en/models/fable-5-1/migration-guide