Anthropic在官方研究博文中明确表示,Mythos Preview是一个研究模型,能够自主识别并利用真实软件环境中的零日漏洞。这项工作的定位是网络安全研究,协同披露与纵深防御是整个响应的核心。但测试结果本身也同时展现了一种可能性:那些帮助防御者更快找到漏洞的能力,同样可以被整合进攻击性的网络行动中。

为了让模型真正完成从理解代码、发现缺陷到复现攻击的完整链条,Anthropic为Mythos Preview搭配了Claude Code作为脚手架。模型首先分析目标代码库,接着尝试在受控环境中复现潜在漏洞,最后自动生成概念验证利用代码。不是停留在理论基准层面,而是验证一个由模型驱动的系统能否走完实际安全工作的关键步骤。

打开网易新闻 查看精彩图片

测试覆盖的软件范围相当广泛,且都是公开可用、实际部署的项目:Firefox浏览器、Linux内核、OpenBSD、FreeBSD的网络文件系统服务,以及多个密码学库。这些目标横跨了浏览器、操作系统、网络服务和加密库等安全领域,从设计上就是为了检验模型在面对不同类型代码和攻击面时的表现。

根据Anthropic的统计,Mythos Preview在整个测试中大约产生了181次有效利用,并在29个案例中实现了寄存器控制。需要注意的是,这些数字是多个安全领域和任务类型的汇总结果,包括浏览器的JIT堆喷射、内核逻辑错误和网络服务的远程代码执行等,不能直接视为模型在所有软件或漏洞类别上的通用性能度量,但它确实呈现了Anthropic所测试的那种端到端攻击任务形态。

在众多实验中,密码学库的部分尤其值得关注。加密代码的缺陷一旦被利用,可能会直接破坏依赖机密性、完整性、认证或密钥管理安全的系统。Anthropic在附录中列出了若干密码学库的报告,并使用了密码学承诺来证明漏洞在测试时确实存在,同时以此支撑负责任的披露流程。

这些成果之所以以防御需求的面貌呈现,是因为公开的技术细节本身就可能在被修复前制造风险。Anthropic指出,超过99%的被发现漏洞并未公开报告,原因或是补丁状态尚未就绪,或受限于披露时机。研究团队因此强调,这些发现应被视作防御必要性的证据,而不是一份利用指南。

总体来看,这项工作并不表示AI已经解决了密码学研究,或者可以替代安全专家。加密审查仍然需要谨慎的假设、实现上下文和独立的验证。然而,Anthropic的实验表明,能力较强的模型或许能在防御性漏洞研究中扮演一种全新的助手角色——既能提高发现漏洞的效率,也让漏洞的治理边界变得更加紧迫。同样的