作者|华卫
昨夜,Anthropic 发布了 Opus 5 模型,这是其长期主打的重磅模型的最新版本。值得注意的是,在公告中列出的多项基准测试中,Opus 5 实际表现优于 Fable 5。
据 Anthropic 介绍,Opus 5 的能力接近其商用最强模型 Fable 5,而价格仅为后者的一半,且安全限制比 Fable 模型更宽松,很可能在大多数使用场景中成为更优选择。
距离 5 月 28 日上线的 Opus 4.8 仅过去两个月,Opus 5 便已推出,这是 Anthropic 在不到两个月内推出的第四款模型。Mythos 5、Fable 5 和 Sonnet 5 均在 6 月发布,目前只剩下轻量级模型 Haiku 仍在等待升级至 5 系列。
1 编码能力超越 Fable 5,还不受数据约束
这次,软件开发是 Opus 5 最大的改进之一。除此之外,在以业务和生产力为中心的应用方面也展现出了优势。
一张由 Anthropic 制作的基准测试图表显示,在知识工作方面的表现优于其以往任何模型,在编码任务上也显著优于 Opus 4.8,大致与备受追捧的 Fable 模型相当或略胜一筹。在几乎所有类型的任务中,它都明显优于 Opus 4.8 和 OpenAI 的 GPT-5.6-Sol。
在 Frontier-Bench(一项衡量模型能否根据工程图纸构建可用软件的编码评估)中,Opus 5 的得分较前代翻倍有余,并超越了所有竞品,包括 Fable 5。在测试新颖问题解决能力的 ARC-AGI 3 上,Opus 5 的得分约为次优模型的 3 倍。
在宣布新模型的博文中,Anthropic 强调,Opus 5“在验证自身工作并反复推敲直至成功方面更加强大”,并引用了基准测试中的例子:Opus 5 根据一个不完整的提示词自行编写了计算机视觉处理流程,此外还有其他案例。
据 Claude Code 工程师 Thariq Shihipar 称,Anthropic 在其最新型号中移除了 80% 的 Claude Code 系统提示,包括 Opus 5 和 Fable 5 等模型,而编码评估结果并未受到明显影响。
该公司还称,它在科研方面也更出色,尤其擅长预测蛋白质序列变异如何影响分子功能等任务。与此同时,该公司指出,已成功让该模型更难被“欺骗”。当前,Opus 5“展现出最低比例的欺骗性行为”。
并且,与其前代一样,Opus 5 不受涵盖 Fable 和 Mythos 的 30 天数据保留政策约束,该政策是与 Fable 和 Mythos 5 一同推出的,此前曾引发部分注重隐私的用户的担忧。
因此,Anthropic 预计,Opus 5 将成为大多数用户需要完成工作时的首选模型。此前,大家对 Fable 的不满之一就是其施加的安全限制。Anthropic 曾实施一套机制,Claude 会将涉及某些主题的提示词路由至 Opus 4.8 而非 Fable 5。许多人认为这些限制过于严苛,使得 Fable 在某些任务上几乎不可用。
不过,Opus 仍然设有实质性的安全护栏,但是在“较窄范围”的特定任务上进行的,特别是在漏洞利用生成和渗透测试等网络安全任务方面。例如,Opus 5 的护栏禁止其被用于扫描软件二进制文件中的漏洞,但允许其在源代码中搜索漏洞,因为后者更可能用于防御目的。
对此,Anthropic 表示,“Claude Opus 5 的安全措施旨在允许模型在网络安全和生物学领域的良性使用”。“根据我们的测试,我们预计分类器的干预频率将比 Fable 5 低约 85%。”Anthropic 称。
该公司还推出了一款新工具,以便在安全措施触发时降低其干扰性。用户现在可以选择加入一项名为“自动回退”(Automatic Fallbacks)的测试功能,当提示词触发安全分类器时,该功能会自动将请求路由至能力较低的模型。这样一来,开启该设置的 API 用户将获得功能性响应,而不是收到错误信息。
据悉,Opus 5 在网络安全方面比 Opus 4.8 更强大,但在漏洞利用开发方面仍远逊于 Mythos 5。
2 关键在于 token 效率,而非能力跃升
“Opus 5 专为日常使用而设计:它比其他模型更高效。它是 Claude Max 的新默认模型,也是 Claude Pro 上最强的模型。”这是 Anthropic 对该模型的定位。
定价方面,Opus 5 的 API 费用将维持每百万输入 token 5 美元、每百万输出 token 25 美元。Anthropic 还为 Opus 增加了一个“effort”菜单,用户可调整以指示模型是希望更详尽,还是更快更高效以节省 token。
近来,Cursor 和 Meta 等公司也在做类似工作,构建了一套“模型路由器”,即根据提示词的性质,从一系列选项中自动选择不同规模和能力的模型的系统。其思路是,不必为每个任务都使用 Fable 这样的模型,从而节省大量 token(进而节省算力和 / 或资金)。
Anthropic 称,在多项相关评估中,Opus 5 都是他们性能最佳、成本效益最高的模型。
在 CursorBench 3.2 测试中,在最大工作量下,该模型的性能与 Fable 5 的峰值得分相差不到 0.5%,但单项任务成本却只有后者的一半;此外,在高、超高和最大工作量下,Opus 5 在相同成本下也优于所有其他模型。
在知识型工作和问题解决任务中,该公司也观察到了类似的结果。例如:在 Zapier AutomationBench 测试中(该测试用于衡量模型能否从头到尾完成业务任务),Opus 5 的通过率约为同等成本下性能次优模型的 1.5 倍。即使在最低工作量设置下,Opus 5 完成的任务数量也超过任何其他模型。
在 OSWorld 2.0(一款计算机使用基准测试软件)中,Opus 5 在任何给定的价格下都优于其他所有型号,并且以略高于 Fable 5 三分之一的价格超越了 Fable 5 的最佳成绩。
Opus 5 的早期客户也报告称,资源使用量有所降低。Harvey 应用研究负责人 Niko Grupen 表示,该模型“在最大推理设置下,与 Opus 4.8 相比,平均生成的 token 数量减少了 26%,同时保持了相近的性能”。Zapier 首席执行官兼联合创始人 Wade Foster 表示,Opus 5“登顶了 Zapier AutomationBench 排行榜,且消耗的 token 数量不超过之前的 Claude 模型”;他补充说,之前的模型未能通过测试,而 Opus 5 达到了 100%。
Artificial Analysis 评估了包括 Opus 5 在内的各热门模型完成相同任务的成本,根据其最新数据,每项 Intelligence Index 任务的加权平均成本(美元)为:Fable 2.75 美元,Opus 5(最高设置)2.03 美元,GPT-5.6 Sol(最高设置)1.04 美元,Kimi K3 0.95 美元。
现在看来,Opus 5 在各项基准测试显示出的迭代提升,虽非性能上质的飞跃,但主要卖点或在于 token 效率。
Anthropic 研究产品管理负责人 Dianne Penn 在接受采访时表示,用户应该选择 Opus 5 来获得更高的性价比,而选择 Fable5 来处理“持续数天的、高度自主的项目”。
当被问及 Kimi K3 时,Penn 称,开源模型在用户委托 Claude 处理的复杂实际项目中表现如何“还有待观察”。“从我们的反馈和客户群体来看,企业看重的是价值。如果模型或产品更便宜,但无法达到相近的质量水平,那实际上并没有什么用。”
https://www.anthropic.com/news/claude-opus-5
https://artificialanalysis.ai/?cost=cost-per-task
声明:本文为 InfoQ 整理,不代表平台观点,也不构成投资建议,未经许可禁止转载。
会议推荐
做 AI 的谁还没点技术焦虑,来 AICon 深圳站,吃颗技术定心丸! 大会限时 9 折专属优惠,现在报名立减 580,更多详情可扫码或联系票务经理 13269078023 进行咨询。