打开网易新闻 查看精彩图片

如果只看实际使用量,Fable 5 很难算得上一款成功的旗舰模型。

作为 Anthropic 产品线里定位最高、价格也最贵的模型,Fable 5 上线后并没有拿到与旗舰身份相匹配的使用规模。Ramp 数据显示,Fable 5 只贡献了 Anthropic 企业端约 6% 的 Token 消耗量。

再加上数据留存政策带来的企业合规限制,很多客户最终选择了更便宜、更容易采购的 Opus 5。然而让人意外的是,Anthropic 并没有因此放慢旗舰模型的更新速度。

打开网易新闻 查看精彩图片

官方博客 https://www.anthropic.com/claude-fable-and-mythos-5-1

就在刚刚,Anthropic 正式发布 Claude Fable 5.1 与 Claude Mythos 5.1,新模型已经开始登陆 Claude、Claude Code、API,以及 AWS、Google Cloud 和 Microsoft Azure 等平台。

按照 Anthropic 的说法,Fable 5.1 和 Mythos 5.1 实际采用同一个模型,区别主要来自安全限制。Fable 5.1 面向普通用户和企业开放,Mythos 5.1 则拥有更宽松的网络安全和生命科学权限,目前只通过可信访问计划提供给经过审核的机构和研究人员。

相比单纯刷新 Benchmark,Anthropic 此次明显将更多精力放在 Fable 5 上线后暴露出的实际部署问题上。价格、数据留存、安全机制误判,以及 Agent 长时间运行成本,都成为 Fable 5.1 重点调整的方向。

Claude 开始进入「无人值守」时代

性能依然是 Fable 5.1 最显眼的升级之一。

更多跑分图如下:

打开网易新闻 查看精彩图片

Anthropic 还特别强调,Fable 5.1 在 Low 或 Medium Effort 模式下,已经能够以更低成本达到接近甚至超过 Fable 5 的效果。Claude Code 默认使用 High Effort,Claude Cowork 和 Claude.ai 默认则为 Medium Effort。

Benchmark 上的提升很快也开始出现在开发者的实际测试中。

开发者 Harshith 使用相同提示词分别让 Fable 5 High 和 Fable 5.1 High 在 Claude Code 中生成 Three.js 版空客 H145 直升机 3D 模型,最终表示 5.1 的结果已经让他重新考虑购买最高档订阅。

打开网易新闻 查看精彩图片

Krax 则把 Fable 5 和 5.1 放进自己制作的 PortraitBench 测试自画像生成能力,并表示第一次对比已经让他开始期待 5.1 在其他视觉编程任务里的表现。

打开网易新闻 查看精彩图片

另一位开发者 S 使用 Fable 5.1 配合 Tesana,在几个小时内通过一个提示构建出一款支持多人游玩的 ARC 生存游戏,其中包含烹饪、制作、狩猎、恐龙驯服和 Boss 战等系统,开发者称最终可玩内容超过 20 小时。

打开网易新闻 查看精彩图片

开发者 wick 展示的测试也体现了类似倾向,在相同提示词和没有额外插件的条件下,他认为 Fable 5.1 的生成结果相比此前版本出现了相当明显的变化。

打开网易新闻 查看精彩图片

相比这些一次性生成案例,Anthropic 自己更愿意强调 Fable 5.1 能够连续工作多久。

投资机构 Millennium 在内部测试中,让 Fable 5.1 分析一个已经存在四五年的罕见程序崩溃问题。该故障大约每运行一百万次才会出现一次,此前公司的工程师以及包括 Fable 5 在内的其他模型都没有定位原因。

Fable 5.1 最终反汇编了第三方厂商的代码库,并结合 Core Dump 进行分析,最后将问题定位到了外部库中的一个 Bug。

Ramp 的测试更加接近典型的长周期 Agent 场景。在一次机器学习任务中,Fable 5.1 连续自主运行 38 个小时,首先判断此前实验结果受到标签问题影响,随后修正问题,并行启动六组实验,运行一整夜之后继续返回实验结果和后续建议。

MongoDB 的工程师则让 Fable 5.1 根据内部服务代码和文档设计一个复杂原型。模型先进行了跨服务研究,随后连续运行数小时完成实现和验证,整个过程基本没有人工持续干预。

Shopify 的工程师也提到,相比 Fable 5,新模型在长时间无人值守任务中更容易保持任务上下文,能够自行记录进展,在条件发生变化以后重新调整优先级,并继续从之前的位置完成工作。

Agent 能力之外,科研也是 Anthropic 此次重点介绍的方向。

比如在蛋白质设计实验中,Anthropic 使用 Mythos 5.1 使用生成结合剂并交由外部机构验证,最终的结果也表现优异,高于行业常见的 10%至 15%。

打开网易新闻 查看精彩图片

在计算生物学方面,Mythos 5.1 优化了七个开源蛋白质和基因组模型的 GPU Kernel,使 NVIDIA H100 推理速度提升约 1.4 倍至 2.5 倍,并预计降低大规模基因组分析的 GPU 成本约 30%至 60%。

打开网易新闻 查看精彩图片

类似能力已经开始延伸到更加开放的研究问题中,一项名为 Cyphral Distich 的测试直接把一个约 370 年无人破解的密码问题交给 Fable 5.1,测试方称模型在不到一天内给出了解法。

打开网易新闻 查看精彩图片

简言之,Fable 5.1 和 Mythos 5.1 都针对实际使用中的核心需求进行了多项优化,整体性能也得到大幅提升。

卷完性能,卷价格

Fable 5.1 最直接的变化来自价格。

新模型的基础 API 定价没有变化,输入依旧为每百万 Token 10 美元,输出为每百万 Token 50 美元,但 Anthropic 将 Cache Read,也就是模型重复读取已经处理过的上下文的价格降低了 75%,目前为每百万 Token 0.25 美元。

打开网易新闻 查看精彩图片

https://platform.claude.com/docs/en/about-claude/pricing

按照 Anthropic 对今年 8 月实际工作负载进行的测算,在 Claude Enterprise、Claude Code 和 API 等典型使用场景中,Fable 5.1 的总体成本预计比 Fable 5 下降约 25%。对于大量读取历史上下文、频繁调用工具的复杂 Agent 工作负载,成本下降幅度最高可以达到约 45%。

打开网易新闻 查看精彩图片

缓存价格之所以在这一代变得重要,与 Agent 的工作方式有关。

传统聊天模型通常处理一次请求后就结束任务,而 Claude Code 一类 Agent 会持续读取代码库、工具结果和历史上下文,有些任务甚至连续运行数小时。运行时间越长,重复读取上下文产生的 Cache Read 越多,相关成本也越明显。

Cognition 联合创始人 Walden Yan 表示, Fable 5.1 在测试中达到或超过 Fable 5 的水平,同时单任务成本更低,因此公司准备将 Devin 的部分 Opus 5 流量迁移过去。随着 Cache Read 降价,一些过去受成本限制、仍由 Opus 处理的代码审查任务,也可以转向 Fable 5.1。

不过,虽然 Fable 5.1 降价了,但和竞争对手相比,它依然称不上便宜。

AI/ML API 使用完全相同的提示词测试 Fable 5.1 和 GPT-5.6 Sol 生成五个连续的 Three.js 场景,前者一次任务花费 5.69 美元,后者只有 0.88 美元,Fable 5.1 用约六倍成本换来了更密集的海浪、海岸线、水晶吊灯和水上乐园等视觉细节,但两款模型最终都出现了不同程度的场景状态错误。

打开网易新闻 查看精彩图片

价格之外,数据留存也是此次升级试图解决的问题。

Anthropic 推出了一套名为 Enterprise Frontier Safeguards 的企业安全系统,简称 EFS。使用 EFS 以后,客户的数据将存储在企业自行控制的云基础设施中,而非 Anthropic 的服务器,默认情况下需要人工审核的内容也由客户自行处理。

EFS 计划从今年秋季开始分阶段上线,未来将覆盖 Claude Code、Claude Enterprise、Claude Platform、Amazon Bedrock、Google Agent Platform 和 Microsoft Foundry。正式开放以前,符合条件的企业可以直接通过零数据留存方式使用 Fable 5.1。

安全机制的误判率也有所下降。

在网络安全场景中,Anthropic 称 Fable 5.1 的新版安全机制相比此前平均减少约 60%的干预。新模型现在允许开发者直接寻找软件漏洞,也就是进行防御性质的漏洞分析,不过渗透测试、Exploit 生成以及基于二进制文件的漏洞扫描等双重用途任务,仍然会受到限制或转交其他模型处理。

生命科学领域的机制也进行了类似调整。相较 Fable 5 刚推出时的安全系统,新版机制针对基础生物学和普通医疗问题的误触发次数减少约 85%,更加专业的生命科学研发任务依旧受到额外限制。

最强 Claude 有了,Mythos 只给「持证玩家」

Fable 5.1 与 Mythos 5.1 最特殊的设计,依旧是 Anthropic 开始更明确地将模型能力与模型权限分开管理。

按照官方说明,两个版本使用相同的基础模型,Mythos 5.1 在网络安全和生命科学领域拥有更加宽松的安全机制,因此不会直接向普通用户开放。

网络安全领域,Anthropic 称 Mythos 5.1 是公司目前发布过网络安全能力最强的模型,不过按照其 Frontier Compliance Framework,目前仍然处于较低风险级别。

Anthropic 同时委托外部机构对 Fable 5.1 的网络安全机制进行了压力测试,其中包括 Gray Swan 的自动化测试。公司称目前仍然没有发现能够达到 Critical Severity 标准的安全绕过方式。

打开网易新闻 查看精彩图片

网络安全用户则可以通过 Cyber Verification Program 获得类似权限。目前该项目主要提供部分 Opus 和 Sonnet 系列模型的低限制访问,后续也将加入 Mythos 系列。

Anthropic 的代码安全产品 Claude Security 也已经开始使用 Mythos 5.1,主要用于扫描代码库中的漏洞,并为人类审核人员提供修复建议。

模型权限提高以后,Anthropic 同时继续加强反蒸馏限制。

从 Fable 5.1 开始,当地时间 9 月 2 日以后创建的新 API 账户将无法在多轮对话中手动修改 Claude 的历史上下文,同时继续保留模型此前的完整思考记录。

Anthropic 认为,此前这种机制可以被用于工业规模的模型蒸馏,通过大量虚假账户批量提取 Claude 的推理能力。新限制暂时不会影响现有账户,但未来发布的新模型会逐渐扩大适用范围,一些依赖相关机制的定制 API 集成后续可能需要调整。

打开网易新闻 查看精彩图片

另一个新增变化来自文字水印。

根据欧盟当地要求,Fable 5.1 也因此加入了一套不可直接看到的数字水印机制。Anthropic 称,水印不会包含用户身份、机构信息或对话内容,也不会改变模型输出质量。

此外,Anthropic 还将同时开始提供水印检测 API 的 Private Preview,目前主要开放给监管机构、执法机构、媒体、事实核查组织、独立研究人员、教育机构、欧盟民间组织以及有相关合规义务的企业。

从 Fable 5.1 的变化来看,Anthropic 已经清醒地意识到模型的性能当然还可以继续追求最强,但今天的市场,已经越来越不只奖励「谁能拿第一」。

最近,智谱的牛来模型和阿里的 Qwen 3.8 Flash,也都在尝试用更低的价格,提供接近旗舰模型的能力。某种意义上,这就是大模型行业正在出现的「智能密度斩杀线」。

打开网易新闻 查看精彩图片

当这条斩杀线不断上移,旗舰模型就会陷入一种越来越熟悉的困境。

领先者为了守住第一,需要投入更多算力,承担更高昂的训练成本,建设更复杂的基础设施,同时还要依靠更高的价格,维持原有的收入和利润结构;

后来者面对的任务却简单得多,它甚至不需要真正超过你,只要做到足够接近,再把价格压到你的十分之一,就能对你构成实质性威胁。

这就是所谓的「领先者的诅咒」。

你比我强一点,当然没关系。但如果我只花你十分之一,乃至百分之一的成本,就能完成和你差不多的工作,那你可就真的要遭老罪了。

我们正在招募伙伴

简历投递邮箱 hr@ifanr.com

✉️ 邮件标题 「姓名+岗位名称」(请随简历附上项目/作品或相关链接)

打开网易新闻 查看精彩图片