冷知识,昨天是奥特曼看到原子弹爆炸一周年
今天,Claude Opus 5 发布了
第一感觉是:Anthropic 终于把 Fable 5 的能力,做成了可以长期使用的模型
我之前体验 Fable 5,能力确实很强,但是贵的离谱
这种模型更像是 Anthropic 用来展示能力上限的,偶尔体验一下可以,真拿来跑 Claude Code、Cowork 和各种 Agent 工作流,我肯定舍不得
Opus 5 就现实多了
价格继续保持 Opus 4.8 的水平,输入每百万 Token 5 美元,输出 25 美元,但是能力已经非常接近 Fable 5。官方公布的 CursorBench 3.2 只差 0.5%,OSWorld 2.0 甚至用大约三分之一的成本超过了 Fable 5,Fast Mode 速度还能提升到默认模式的 2.5 倍。
这个官方图表居然还有标红错误,Agentic coding 那里 53.4% > 53.5%
当然,Benchmark 看看就好
我反而觉得 Opus 5 释放了一个更明确的信号:现在大模型竞争的重点,正在从“谁能做出最惊艳的答案”,转向“谁更适合被大量、反复地调用”
过去发布一个旗舰模型,大家先看它有没有刷新榜单,推理又提高了多少分。现在真正用 Agent 的人更关心的是:一个任务到底要跑多少 Token、需要返工几次、中途会不会跑偏,最后能不能不靠人盯着把事情做完
一个模型单次调用便宜,不代表整个任务真的便宜
尤其是 Claude Code 这类 Agent 场景,模型如果理解错一次需求、改错几个文件,或者跑到一半忘了验证,后面消耗的 Token 和人工时间可能远远超过模型本身的差价
所以 Anthropic 这次反复强调的 judgment,我觉得比那些 Benchmark 数字更有意思。
现在不少模型写代码已经很强了,但是 Agent 真正干活时,问题往往不是“不会写”,而是太容易觉得自己已经写完了
需求有没有真正理解,Bug 是不是只修了表面,页面在手机端会不会跑出去,结果有没有实际验证,很多模型都需要人在后面不停提醒
Opus 5 这次重点提升的恰好就是这些:它会主动检查需求、寻找根因、运行测试,必要时甚至自己补一个工具来验证结果,而不是代码能运行就急着宣布任务完成
这也解释了为什么 Opus 5 看起来没有 Fable 5 那么“炸”
Fable 5 更像是 Anthropic 为少数高价值、超长周期任务准备的能力上限,适合那些成本不是第一优先级、模型需要自主运行很久的工作;Opus 5 则明显是面向更普遍的编程、办公和企业 Agent 场景
不是每个任务都需要最聪明的模型,但大多数任务都需要一个足够聪明、价格可以接受,而且不需要你一直跟在后面擦屁股的模型
从这个角度看,Opus 5 可能不是 Anthropic 最惊艳的一次更新,却可能是目前最适合真正干活的 Claude
Fable 5 负责告诉大家天花板有多高,Opus 5 开始负责把这套能力真正卖出去
热门跟贴