7月25日凌晨,Anthropic发布了Claude Opus 5。按命名习惯,它本应是上一代产品的继任者,定位在Sonnet之上、Fable之下的中间型号。但基准测试数据一出来,这条界线就被彻底打破了。

这款定价每百万输入token 5美元、输出token 25美元的模型,在编程、自主搜索、计算机使用、企业业务流程等多个关键评测上,直接超过了定价10美元/50美元的Fable 5。而它的成本,只有后者的一半。

打开网易新闻 查看精彩图片

Anthropic在官方公告里表述相对克制,称新模型“以一半价格接近Claude Fable 5的前沿智能”。但他们自己发布的图表显示,它在至少四项核心评测中明确领先Fable 5,而且耗时更短、消耗更低。

先看编程能力。Frontier-Bench v0.1要求模型在终端里自己写代码、跑代码、调试多文件变更,最能映射企业开发实际工作流。新版拿下了43.3%,Fable 5是33.7%,差距接近10个百分点。作为参照,上一代旗舰在同一个测试上只有21.1%,这次直接翻了一倍多。

在CursorBench 3.2上,该模型在最高推理强度下达到Fable 5峰值成绩的94.5%,单次任务成本只有一半。Anthropic还宣称,在high、xhigh和max三个推理等级上,它同成本下的性能都超过了所有其他模型。Cognition(Devin背后的公司)CEO Scott Wu在FrontierCode 1.1评测后确认,这款新品在调试和根因分析方面以一半成本达到了接近Fable级别的性能。

自主搜索拿到90.8%,Fable 5是87.4%,十次搜索有九次以上能独立完成。计算机使用(OSWorld 2.0)上,它在约三分之一成本下就超过了Fable 5的最优成绩。企业业务流程自动化则拿到26%,Fable 5只有17.4%。

科学领域同样有明显提升。有机化学任务比上一代高出10.2个百分点,覆盖从光谱数据推断分子结构;蛋白质相关任务高出7.7个百分点,涉及预测序列变异对功能的影响。在Humanity's Last Exam上,开启工具后成绩为64.7%,Fable 5是63.9%,差距不到一个百分点。

但真正让整个AI研究圈按下暂停键的,是ARC-AGI 3的成绩。

ARC-AGI 3专门用来衡量“流体智能”,把模型扔进完全陌生的交互式环境里,没有指令、没有规则说明、没有目标提示,只能靠试错自己摸索。人类能完成100%的任务。今年3月刚推出时,最强AI得分仅为0.37%;到这款新品发布前,公开最高分是GPT-5.6 Sol在最大推理强度下拿到的7.8%。上一代旗舰更是只有1.5%。

而它拿到了30.2%,是GPT-5.6 Sol的近四倍,上代旗舰的二十倍。

这个数字的意义远超任何编程或搜索基准。它奖励的不是“做过类似的事所以能做”,而是“从没训练过也能做”。30.2%意味着这个模型确实在通过交互推导陌生的规则体系,而不是靠模式匹配硬猜。Vellum AI的基准分析文章直言:“这个数字让所有人都停下了滚动。”

基准分数告诉我们它考了多少分,Anthropic公布的案例则展示了是怎么考到的。

一个3D建模任务,只给一张机械零件设计图纸,要求自主编写代码重建完整的FreeCAD 3D模型。此前没有任何模型能完成这个任务,即便人工提前搭好开发框架、给出详细方案,模型依然会出错。这次它不仅完成了全过程自主闭环,还自己搭建了配套测试工具,逐一校验代码的数据解析逻辑,反复核查修正问题,直到通过验证。

Zapier CEO Wade Foster透露,团队用它处理客户健康度原始表格,要求AI独立完成全套客户流失预防流程,包括标记高风险账户、通知对应负责人、整理运营报告。“以前的模型没有能完整跑通这条流程的,”Foster说,“它做到了100%完整交付。”