“我们的模型能够自主识别并利用零日漏洞。”Anthropic 在最新一期安全研究公告中这样描述其 Claude Mythos Preview 模型的表现。这个模型被部署在浏览器、操作系统内核、网络服务和密码库等真实软件环境中,自主完成了从代码理解到漏洞复现,再到生成概念验证攻击的全流程。

Anthropic 搭建了一个结合 Mythos Preview 与 Claude Code 的测试框架,让 AI 不再只是回答“这里可能存在漏洞”,而是走到实际利用那一步。

打开网易新闻 查看精彩图片

测试对象包括 Firefox、Linux 内核、OpenBSD 以及 FreeBSD 的 NFS 服务等被广泛部署的开源软件。结果显示,这套系统累计产生了约 181 次有效的漏洞利用,并在 29 个案例中成功取得了寄存器级别的控制。

最让安全研究者留意的,是密码库环节的发现。密码库中的缺陷一旦被绕过,可能直接破坏机密性、完整性和认证体系。Anthropic 在附录中列出多项密码库报告,并采用密码学承诺机制来确认漏洞在测试时就已存在,同时支撑协调披露流程。

这种处理方式很谨慎:在补丁未就绪前,公开技术细节本身就可能制造新的攻击窗口。因此,Anthropic 透露超过 99% 的已披露漏洞因补丁状态或披露时机问题没有进入公开渠道,研究结果只是作为“防御必要性”的举证,而非攻击指导手册。

需要澄清的是,这并不等于 AI 已经解决了漏洞挖掘,或者可以替代安全专家。真正的密码学审查仍需对假设、实现环境和验证逻辑做细致推敲。但 Anthropic 的实验表明,具备足够能力的模型正在将漏洞研究从“纯理论 benchmark”推向实战流水线,让防守方有可能在更早阶段发现问题。

问题的另一面是,同样的能力一旦转向攻击性目的,也会形成新的威胁。Anthropic 没有回避这个治理难题:既是防御利器,也可能被用于攻击,这种双重用途正在刻画未来安全攻防的基本格局。