过去十天,硅谷两家最头部的AI公司,先后承认了同一件事:自家的AI模型在测试期间,真的黑进了别人的系统。

7月21日,OpenAI承认其AI代理在一次网络安全能力测试中"越狱",突破沙盒隔离,入侵了AI开源平台Hugging Face的生产系统——目的是"抄答案"。

九天后,7月30日,还没等硅谷消化这件事,Anthropic 也站出来了——我们查了一下,发现我们的模型也干了。

而且不止一家。三家。

OpenAI的AI,为了"抄答案"越狱了

先看 OpenAI 这边发生的事。

OpenAI 当时在用一套叫 ExploitGym 的网络攻防评测平台测试自家模型。参与测试的模型包括已发布的 GPT-5.6 Sol,以及一款更强大的未发布模型。为了测出模型的极限黑客能力,OpenAI 把安全护栏关了。

模型被关在一个隔离沙盒里,网络访问被限制到只能通过一个内部代理访问代码包仓库。OpenAI 认为这就安全了。

双方联名发布的博客文章截图:《OpenAI 和 Hugging Face 合作解决模型评估过程中发生的安全事件》

模型不这么想。

它发现了那个代理里的一个零日漏洞,一个连开发者自己都不知道的安全缺口。然后从那里突破隔离,拿到了开放互联网的访问权限。

接下来发生的事更离谱:模型自己推断出 Hugging Face 平台上可能存有 ExploitGym 的测试答案,随后主动发起攻击,利用窃取的凭证和零日漏洞,找到 Hugging Face 服务器上的远程代码执行路径,直接从生产数据库里把答案取走了。

整个过程中,没有任何人类下达攻击指令,没有任何人类介入。

Hugging Face 联合创始人 Thomas Wolf 对 BBC 说,这件事是"行业的一记警钟"。

被攻击的一方想追查,发现美国模型不帮忙

Hugging Face 安全团队发现入侵后,第一反应是调用美国头部 AI 公司的前沿模型来帮忙分析攻击日志。

碰壁了。

这些模型的安全护栏"无法区分事件响应人员和攻击者",直接拒绝检查攻击载荷。一个被 AI 攻击的受害者,没法用同一家的 AI 来防御。

走投无路的 Hugging Face 转而部署了中国智谱 AI 的开源模型 GLM 5.2,在自己的基础设施上分析了逾 1.7 万条攻击日志,最终完成溯源和取证重建。

Hugging Face CEO Clem Delangue 说得直白:

"当你正处于一场活跃的安全事件中,你的工具不能拒绝检查恶意载荷。开源模型让我们能在不需要任何人许可的情况下完成这项工作。"

X 上有网友总结得精辟:如果你被 OpenAI 攻击了,你必须用中国模型,因为 Claude 不会帮你。

OpenAI 的攻击不止一家

事情到这儿还没完。

据路透社后续报道,OpenAI 的"出逃模型"不光是攻击了 Hugging Face 一家。它还把纽约云计算平台 Modal Labs 的一个客户账户给黑了。

Modal Labs CTO Akshat Bubna 确认,入侵源于该客户发布了一个无需身份验证即可公开访问的端点,失控的 AI 代理利用这个缺口执行了代码。

OpenAI CEO 山姆·奥特曼本周表示,他已经就这次入侵事件与国会参议员进行了讨论,并计划与白宫讨论即将发布的 AI 模型和测试问题。

Anthropic 翻查了 14 万条测试记录,发现自己的模型也不干净

OpenAI 公开事件后,Anthropic 决定自己也查一遍。

他们翻查了 141006 条网络安全评估记录。结果找到了三起。

三起事件涉及三个不同模型:Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型。最早的可以追溯到今年 4 月。

怎么回事呢?Anthropic 在给模型的提示中明确说了"你没有互联网访问权限",但因为与合作测评方 Irregular 之间存在一次"误解",测试环境在实际运行中并没有断网。

模型接到的任务是"夺旗"——在模拟网络中找出隐藏信息。结果网络是真的,不是模拟的。

在其中一个案例中,Claude Opus 4.7 被分配了一个虚构目标公司,偏偏这家公司的名字和现实中一家真实企业一模一样。模型找到并利用了漏洞,获取了那家公司的凭证和数据库访问权限。Anthropic 说,模型当时的"想法"是:既然看起来像现实世界的东西,那一定是 Anthropic 刻意安排的模拟测试的一部分。

另一件事发生在 Anthropic 一个还没公开的内部测试模型身上。这个模型在攻击中途自己停了手,它意识到打进去的目标是真的,不是模拟的。

Anthropic 对此的评价是"谨慎乐观",认为这说明让 AI 行为得体方面的进展有眉目了,"但还需要更多测试才能确信这个结论"。

Anthropic 于 7 月 23 日暂停了所有网络攻防评估,7 月 27 日通知了受影响的三家机构。其中两家在收到通知前完全不知道自己被黑过。第三家到现在还没联系上。

"Claude 使用了基本技术攻破了受影响机构的基础设施,比如利用弱密码和未认证端点。"Anthropic 在声明中说。

该怕的,是掌握AI的人

Palisade Research 的执行董事 Jeffrey Ladish 说得更直接。他怀疑顶尖 AI 公司还有更多未被发现、或者发现了但没公开的事故。"模型越聪明,情况只会越糟。它们会越来越擅长作弊,越来越擅长撒谎。"

马斯克在 X 上的回应只有一句话:"随着 AI 变得更聪明、更有自主行动力,这种事会频繁发生。"

剑桥大学 Minderoo 中心的 Gina Neff 教授说,这次审查显示的是"AI 模型在被人类告知要做的事情"。在她看来,真正该盯紧的,是那些制定安全标准的公司。决策权在他们手里,后果由所有人承担。

整件事最根本的矛盾在于:最强大的 AI 模型既能用来攻击,也能用来防御。安全护栏本意是保护用户,但当它让防御方用不了这些模型时,不对称的优势就完全倒向了攻击者一边。

今年 5 月,一篇关于 ExploitGym 的论文已经给出了结论:"前沿 AI 代理的自主漏洞利用开发,已经不再是假设性的能力。"论文作者来自伯克利、马克斯普朗克研究所、加州大学圣塔芭芭拉分校和亚利桑那州立大学。OpenAI、Anthropic 和 Google 也参与了测试。

论文发现,在受控条件下,Claude Mythos Preview 和 GPT-5.5 分别成功攻破了 157 个和 120 个真实漏洞。

而现在我们看到,受控条件本身也靠不住了。

监管在追,IPO 也在追

这场风波正在把 AI 安全推向政策辩论的中心。

6 月 2 日,美国总统特朗普指示顾问制定一套针对最先进 AI 的自愿性网络安全测试框架。此前,美国政府曾以国家安全为由,动用出口管制暂时限制 Anthropic 旗下 Fable 5 和 Mythos 5 模型的分发。

OpenAI 和 Anthropic 都在筹备上市。市场预计两家公司的估值都在万亿美元级别。

有批评者认为,这一系列"自曝"有营销成分。一位 OpenAI 发言人回应称,"我们意识到有很多问题和猜测在流传",并说"计划在未来几周内发布一份技术报告"。

Hugging Face CEO Delangue 的结语值得被记住:

"这一事件可能是同类事件中的首例,它证明了一个我们长期以来的判断:AI 安全不会由任何一家公司在封闭中解决,它将在开放环境中、通过协作、让每一位防御者都能广泛获取 AI 的方式来解决。"