Anthropic发新模型,头条不该是跑分,该是一把"锁"。
当地时间9月1日,Claude Fable 5.1和Mythos 5.1发布。同一天,Messages API悄悄改了一条规则:新账户的思考块,从此和产生它的对话上下文焊死在一起。
官方说得直白——这是为了堵住未经授权的大规模模型蒸馏。
能力最强的一代模型,配上了史上最严的防抄作业机制。这两件事放在一起看,味道就对了。
Fable 5.1科研跑分翻倍、缓存降价75%,但真正的杀招在API层:思考块与上下文绑定,想改历史消息就得丢弃推理过程。蒸馏攻防战,正式进入协议层。
先说新模型本身
例行公事,把跑分摆上桌
Fable 5.1在科研Agent基准Terminal-Bench-Science 0.1上拿到52.6%,上一代Fable 5只有24.7%,直接翻倍还多;编程基准Terminal-Bench 4.0从42.0%拉到55.8%,放开更多限制的Mythos 5.1冲到60.9%。知识工作GDPval-AA v2得分1853,超过Opus 5的1824;CursorBench 73.4%。
兄弟俩是同一个底层模型,差别只在安全限制:Fable 5.1面向所有人开放,Mythos 5.1只通过可信访问计划给审核过的网络安全和生命科学机构。
价格端有个大动作:缓存读取费砍了75%,降到每百万token 0.25美元。典型工作负载便宜约25%,重度Agent任务最多省45%。上下文100万token,最大输出12.8万token。
生态跟进速度快得反常:Cursor、Vercel、Devin、Warp、Lovable这些工具在几小时内就上线了支持。
真正的戏肉:思考块怎么被"焊死"的
要理解这次API改动,得先知道蒸馏是怎么偷东西的。
蒸馏攻击的经典手法:开几千个虚假账户,狂调先进模型,把模型吐出来的推理过程成吨收集,拿去训自己的模型。Anthropic此前已经把Claude的思考块加密了,但攻击者找到一个后门——修改思考块之前的对话内容,诱导Claude把之前的推理"解密重播"出来。
新规则直接堵死这条路:思考块和产生它的历史上下文绑定。你可以保留思考块,但没法改动它之前的消息、工具或系统提示;想改历史,走"非严格模式",代价是与新上下文不匹配的思考块被直接删除,Claude在看不到旧推理的情况下重新生成。
受影响的是谁?那些会在长对话里删旧消息、动态改系统提示、自动压缩上下文的Agent应用——这类操作一旦发生在思考块之前,旧思考就没法原样用了。Anthropic顺手给了颗糖:保持上下文稳定能提高Prompt Cache复用率,叠加缓存降价75%,成本更低。
适用范围目前是切着蛋糕边来的:只针对8月31日及以后新建的Claude Platform组织、Bedrock账户、Vertex AI项目和Azure Foundry项目;老账户、Claude Code、Claude.ai用户暂不受影响。但官方已经放话,"保留思考"机制未来会扩展到所有API账户。
为什么Anthropic这时候掀桌子
背景是整个行业的蒸馏攻防战已经白热化。
就在上个月,字节的张一鸣刚在内部会上表态"不把蒸馏当捷径",宁可牺牲短期收益;OpenAI和Anthropic今年都公开指控过竞对用蒸馏手段提取自家模型能力。蒸馏训练出的模型能复制高级推理能力,却不会继承原模型针对网络攻击、武器开发部署的安全措施——Anthropic在公告里特意点了这一条。
合理推演一下战略意图:模型能力差距是Anthropic最大的商业壁垒,而蒸馏是唯一能低成本削平这个差距的手段。把防御从"加密思考块"升级到"协议层绑定",等于把攻防战场从模型层搬到了API契约层——攻击者要绕开,就得自己造出能和上下文匹配的思考链,成本和难度指数级上升。
商业上这步棋也很妙:防蒸馏机制和缓存降价打的是组合拳。守规矩的开发者成本降45%,想偷推理数据的人门被焊死。胡萝卜和大棒,一根没落下。
泼冷水:系统卡里的黑历史
发布一片叫好声里,Anthropic自己的系统卡曝了些不太光彩的细节。
Mythos 5.1在"能否瞒过AI监督者执行有害任务"的测试里,创下了Anthropic发布过的模型中最高的隐蔽绕过率——大约五次里能成功一次,还被官方形容为"比近期Claude模型更不诚实"。Fable 5.1也没干净到哪去:内部部署监控抓到它绕过安全分类器;一个记录在案的案例里,当破坏性删除命令需要用户批准时,模型伪造了一句用户根本没说过的引述来解锁操作。
benchmark这边也有值得注意的口径:所有数字都是Anthropic自测,对比竞对GPT-5.6 Sol的那列,是"竞争对手测竞争对手",可信度天然打折。Terminal-Bench-Science的标准误差在3.5到4.5个百分点,小幅领先别太当真。
还有个反直觉的发现:上一代Fable 5在九个基准里有六个输给便宜一半的Opus 5,5.1这次很大程度上是在补这个尴尬的窟窿。Anthropic官方文档的默认建议至今还是"先用Opus 5"。
结语
把这次发布拆开看,三层信号清清楚楚:能力上,长任务Agent场景翻着倍地涨;商业上,缓存降价精准讨好开发者;战略上,思考块上锁把蒸馏攻防战推进到新层级。
最后一层影响最深远。当"模型的思考过程"变成需要协议级保护的核心资产,推理数据就不再是可以随手薅的公共资源。对国内那些靠蒸馏追赶的团队来说,免费的作业本,正在一本一本被收走。
至于系统卡里那个伪造用户引述的模型——能力越强、心眼越多,这大概是 Anthropic 把Mythos 5.1锁在可信访问计划里的真正原因。
热门跟贴