就在刚刚,传闻许久的Anthropic最新接近Fable 5的Opus 5模型终于来了!
Anthropic表示,Claude Opus 5是一款日常使用类型的最强模型,在智能水平上接近 Claude Fable 5,价格却只有其一半。
Opus 5比其他模型更高效,它是 Claude Max 的新默认模型,也是 Claude Pro 上最强的模型。
在 Frontier-Bench和GDPval-AA等编码与知识工作评测中,Opus 5 创下了新的业界最强成绩,不过在网络安全任务上仍落后于 Mythos 5。
其中,在代理终端编码(Frontier-Bench v0.1)上,Opus 5 以 43.3% 的成绩成为新的最先进水平:领先于 Fable 5(33.7%),并且是 Opus 4.8 的两倍多。
Claude Opus 5今日在所有平台上线,定价为每百万输入tokens达5美元、每百万输出tokens达25 美元(与 Opus 4.8 相同),尽管比Fable 5要便宜一些,但比起Kimi K3和DeepSeek V4,Opus 5价格依然很高。
Kimi K3模型的API价格输入每百万Token 3.00美元(约合人民币20元),输出每百万Token 15.00美元(约合人民币100元)。
Opus 5 单价统一是 Kimi K3 的约1.67倍(167%)。或者说,Kimi K3 输入、输出单价均只有 Opus 5 价格的六成。
有提前内测Opus 5的用户评价称,Opus 5的定位很尴尬,如果遇到 最难任务的模型是Fable 5,平时用的聪明、快速通用模型则是GPT-5.6,只有用完Fable额度之后才会使用。
不过,相比4.8来说,终于有个能用的模型了!
具体来说, Claude Opus 5的核心还是性能与性价比。
Claude Opus 5 在与前代 Opus 4.8 相同的价格下,大幅提升了性能。本节的图表展示了性能如何随模型的 effort(努力程度)设置而变化,客户可借此优化智能水平,或节省 token 以换取更快、更便宜的结果。
Opus 5 在高价值的软件工程任务上表现出色。例如,在 Frontier-Bench v0.1 上,Opus 5 超越所有其他模型,单任务成本更低,性能更是 Opus 4.8 的两倍多。
在 CursorBench 3.2 上,开启最大 effort 时,它的成绩与 Fable 5 的峰值仅相差 0.5%,但单任务成本只有一半。
在高(high)、超高(xhigh)和最大(max)三档 effort 下,它在同等成本下的性能也优于所有其他模型。
此外,在知识工作和问题解决任务上,ARC-AGI 3 这项要求模型解决全新问题的评测中,Opus 5 的得分是第二名模型的三倍;衡量模型能否端到端完成业务任务的 Zapier AutomationBench 上,同等单任务成本下,Opus 5 的通过率约为第二名模型的 1.5 倍。
即便在最低 effort 档位,Opus 5 通过的任务也比任何其他模型都多。
在计算机使用基准 OSWorld 2.0 上,Opus 5在仅用略超三分之一的成本就超过了 Fable 5 的最佳成绩。
其他方向上,相比 Opus 4.8,Opus 5 在科学研究方面有显著进步。在我们覆盖结构生物学、有机化学和生物信息学等主题的全部生命科学评测中,它的表现均优于 Opus 4.8。提升最明显的是有机化学任务,比如根据光谱数据推断分子结构(在我们的内部基准上比 Opus 4.8 高出 10.2 个百分点),以及与蛋白质相关的任务,比如预测蛋白质序列的变化如何影响其功能(此处高出 7.7 个百分点)。
实际案例中,在一项 Frontier-Bench 任务中,Opus 5 拿到一张机械零件图纸,被要求编写代码将其重建为 3D FreeCAD 模型。然而在这项任务里,模型被刻意设定为无法直接查看这张图纸。
Opus 5 的应对是:自己编写一套计算机视觉流水线,从原始像素中提取几何信息,然后重建出完整的机械零件。它反复多次成功完成;而采用相同设置的其他竞争模型在尝试五次后仍无人能解。
在自动化行为审计中,Opus 5 的整体错位行为得分为 2.3,是近期模型中最低的。
此外,安全方面,Opus 5 并未在高风险的双用途能力上推进前沿。它在生物学研究和进攻性网络安全方面均落后于 Mythos 5。
与前代 Opus 4.8 一样,团队刻意没有使用网络安全任务来训练 Opus 5。然而,由于模型整体能力的提升,它在这些任务上的表现仍有大幅改进,在发现网络安全漏洞方面已接近 Mythos 5。
不过,在利用这些漏洞,也就是把漏洞转化为实质性网络威胁方面,它仍明显落后于 Mythos 5。在OSS-Fuzz 上,尽管 Mythos 5 和 Opus 5 发现漏洞的成功率相近,但 Opus 5 在开发漏洞利用程序方面的得分远落后于 Mythos 5。
此外,在 OSS-Fuzz 这项网络安全评测上,Opus 5 在识别软件漏洞方面接近 Mythos 5,但在为其开发漏洞利用程序方面则逊色得多。
换句话说,Opus 5是一个性价比高、性能比肩Fable 5,但安全性和智能方向略低于Fable 5的模型。
事实上,当前中美AI处于竞争局势,Kimi K3引爆华尔街和美国市场的关注,而Opus 5被认为是“一雪前耻”、彰显美国技术能力的模型。
今年6月,Anthropic正是发布Claude Fable 5(Mythos 等级公开发行版本),上线并入 Claude Pro 订阅,主打深度推理、长时序 Agent、多模态能力,短期成为全球综合能力最强商用闭源模型;6月12日全球无预警临时下线,引发行业震动;7月1日,Fable 5 面向全球恢复开放访问;同步升级安全防护体系。
到了7月,Kimi发力。
16日,月之暗面正式官宣发布 Kimi K3,2.8 万亿 MoE 参数、原生视觉、100 万 token 上下文;开放 API 与网页端调用,官宣完整权重将于 7 月 27 日前开源 。
发布 24 小时内,早Frontend Code Arena 榜单上,Kimi分数超越 Fable 5 登顶,成为首个在单项核心赛道击败全球顶级闭源模型的国产开源大模型。
从时间轴来说,Fable 5 先发、经历监管动荡走向高价闭源;相隔一个多月,Kimi K3 以开源路线发起正面冲击,形成一闭一开、一西一中的标杆对峙,也让Opus 5成为万众期待的一个重要模型。
对比 Fable 5,两者各有长短。Fable 5 综合通用推理更强,Kimi K3 在长上下文工程、代码任务实现反超,差距已经压缩到可正面较量区间。所谓“只能追赶”的固有认知,正在被实测榜单与真实开发者反馈打破
很显然,Kimi K3、 Fable 5/Opus 5一前一后登场,清晰划出当下 AI 产业两条截然不同的发展路径。
Anthropic 手握顶尖能力,却接连遭遇监管干预,最终选择抬高使用门槛、收缩普惠性,证明海外头部闭源模型正在进入“能力垄断和政策风险”双重约束周期。
而 Kimi K3 选择以开源姿态直接对标全球最强选手,不再单纯依靠低价内卷,而是凭借原创架构冲击 SOTA。
一边是顶级能力逐步封闭、调用成本持续上行;另一边是前沿权重向行业释放。两种路线并行竞争,意味着 AI 的竞赛不再只是算力与跑分,商业模式、开放策略将长期决定各家上限。
Kimi K3 最重大的意义,是第一次让全球看见:中国团队不靠蒸馏复刻,依靠自研注意力架构,能够造出在关键赛道超越全球顶级闭源旗舰的前沿模型
如今,Fable 5 的管制风波是前车之鉴,Kimi K3 的开源选择正是应对这类风险的方案。
长远来看,全球AI大模型领域能够同时兼顾顶尖能力、自主可控、开放生态的玩家,才能在持续动荡的全球 AI 格局站稳脚跟。
胡锡进最近提醒DeepSeek创始人梁文锋,和Kimi创始人杨植麟,尽量不要去美国,否则会面临一定风险。
你怎么看?
©本文为原创内容
未经授权,禁止转载
热门跟贴