按住下方图标,点击小程序

免费领取AI学习资料、精选提示词

今天凌晨2点,Anthropic毫无预热直接甩出王炸,正式上线两款全新神话模型 Claude Fable 5.1与Claude Mythos 5.1。

官方直接给出定论,这是目前全球范围内,综合实力最强的代码开发与知识工作AI模型,专门对标日常办公、专业编码、科研推理、企业自动化等高阶场景。

打开网易新闻 查看精彩图片

除了模型的能力之外,大家最关心的还有成本问题,这次也把价格打下来了。

对比上一代Fable 5,日常办公、代码编写、文案创作这类常规使用场景,整体成本直接下降25%。

降低的核心原因,是Claude下调了缓存读取的计费价格。

简单来说,模型处理过的对话、代码、文档内容会临时缓存,再次调用相同内容时,不用重复计算,这次优化让这类复用操作的费用砍了一大半。

打开网易新闻 查看精彩图片

如果是需要长时间运行、多步骤联动的智能体任务,比如无人值守开发、批量数据分析、自动化工作流处理,成本优势会更夸张,最高能省下45%的费用。

以前需要高端顶配模型才能扛住的复杂任务,现在用Fable 5.1就能低成本搞定。

测试数据

官方这次放了一张覆盖9个维度的基准测试对比表,拿Fable 5.1和上代Fable 5、顶配Opus 5以及友商GPT 5.6 Sol同场竞技,屠榜了全部主流测试。

最夸张的是智能体科研这项,分数直接从24.7%跳到52.6%,翻了一倍多,比顶配Opus 5的29.0%高出将近一倍。

这个测试不是死记硬背的选择题,而是需要模型自己查资料、设计实验方案、写代码跑分析的开放式科研任务,以前只能搞定四分之一,现在能做对一半多,这个跨度确实有点猛。

打开网易新闻 查看精彩图片

编码能力是日常用得最多的,两项编码测试都在涨。终端编码测试从42.0%提升到55.8%。

如果放开安全限制用Mythos 5.1跑,能到60.9%。另一项更贴近真实开发场景的CursorBench,从70.5%涨到73.4%。

业务自动化进步也非常明显,分数从17.1%直接跳到31.4%,差不多翻了一倍。这个测试模拟的是真实企业里的工作流

比如处理审批、整理报表、跨系统操作这类繁琐任务,以前模型只能搞定不到两成,现在能拿下三成多,对企业用户来说意味着能真正放手让AI干更多活了。

知识工作测试从1723分涨到1853分,多学科推理不用工具时从57.8%涨到60.9%,用上工具后从63.8%涨到65.0%。

模型自己操作电脑完成任务的能力也在进步,宽松标准下从72.9%涨到77.9%,严格标准下从36.1%涨到41.7%。

整体看下来,这次升级不是某一项偏科突然爆发,而是全方位稳步提升,最亮眼的恰恰是智能体类任务,也就是需要长时间自主运行、多步骤联动的复杂工作。

科研能力大突破

这次更新最具长远价值的,是模型的科研能力实现了跨越式提升,不再只是服务日常办公,真正可以助力前沿科学研究。

在分子药物设计领域,Mythos 5.1的表现十分亮眼,设计的靶向结合分子,亲和力比行业竞赛最优成果还要高出10倍。

行业常规的有效分子设计命中率只有10%到15%,而整体命中率接近50%,能极大缩短药物研发的试错周期。

在天文地理研究方面,Fable 5.1依托三十多年前的金星探测雷达影像,自主训练生成了全新的高精度金星高程地图。

把原本10至20千米的解析精度,提升到2至3千米,高程测算准确率最高提升25%,能为后续行星探测任务提供重要参考。

打开网易新闻 查看精彩图片

计算生物学领域的提升同样关键,模型可以自主优化GPU运算内核,让七款主流科研模型的推理速度最高提升2.5倍。

打开网易新闻 查看精彩图片

对于需要数万次重复运算的基因组分析任务,优化后能直接降低30%到60%的算力成本。

原本需要专业工程师数周才能完成的性能优化,几天就能搞定,对科研实验室来说是极大的助力。

各行业实测反馈

目前已经有大量科技企业、金融机构、研发团队完成了内测,涵盖量化、云服务、AI开发、医疗、电商、航天等多个行业,都给出了极高的评价。

来自量化交易巨头Jane Street Capital的量化研究主管Craig Falls表示,新模型的代码解决能力和交易逻辑研判能力已经达到行业顶尖水准。

最大的进步是处理超长多步骤任务时,逻辑依旧清晰连贯,不会像旧模型一样,任务流程变长后就出现逻辑混乱、输出杂乱的问题。

打开网易新闻 查看精彩图片

顶级投资机构Millennium的高级投资组合经理Damien分享了一个极具说服力的实测案例,团队数年都没能排查出的系统百万分之一概率罕见崩溃漏洞,试过所有主流AI模型均无果,最终被Fable 5.1精准定位。

打开网易新闻 查看精彩图片

MongoDB高级软件工程师Ron Sanzone表示,新模型的自主落地能力极强,不用人工反复干预,三天就能独立完成复杂项目原型搭建,从代码调研、架构设计到落地实现、成果校验全程自主完成,大幅节省了研发人力。

打开网易新闻 查看精彩图片

需要注意的是,Fable 5.1是大众通用版本,所有人都能正常调用使用。

Mythos 5.1则是受限专业版本,只对经过官方审核的从业者开放,专门适配网络安全、生命科学这类高精尖专业场景,安全管控会更精细化。

目前,Fable 5.1已经全平台公开可用,各大云服务商平台均已上线,普通开发者和企业可以直接接入使用。

Mythos 5.1则依托两大专项可信项目开放,网络安全验证项目面向网络防御从业者,生命科学验证项目面向科研人员。

通过审核即可解锁专业级模型能力,目前也已正式用于企业代码漏洞扫描等专业场景。

AI 实操交流群找一群同路小伙伴一起进步

企业、高校及渠道合作

打开网易新闻 查看精彩图片