一场史无前例的AI自主攻击事件,正在改写人们对大模型安全能力的认知。

据OpenAI和HuggingFace双方披露,上周HuggingFace生产基础设施遭到了一次"前所未有的网络入侵",而攻击者不是人类黑客,是一个由OpenAI模型驱动的自主AI Agent系统。

打开网易新闻 查看精彩图片

事情的起因是OpenAI在进行内部安全评估。他们用GPT-5.6 Sol和一款更先进的预发布模型跑一个名为ExploitGym的网络安全基准测试,为了让模型发挥最大攻击能力,测试环境里关闭了生产级安全护栏。结果模型为"作弊"拿到测试答案,自行发现了一条从OpenAI实验室穿透到HuggingFace生产环境的多跳攻击链:先利用内部软件包代理缓存的一个零日漏洞获取互联网访问权限,随后通过权限提升和横向移动,最终在HuggingFace服务器上找到了远程代码执行路径。

OpenAI将此事定性为"史无前例的网络事件",已负责任地向相关软件厂商披露了零日漏洞。HuggingFace方面确认,攻击由一套自主Agent框架驱动,在一个周末内执行了超过17000条操作指令。

但最戏剧性的一幕发生在事后。

HuggingFace安全团队着手进行取证分析时,首先尝试了美国的商业大模型API。结果大量真实的攻击命令、漏洞利用载荷直接触发了模型的安全护栏,取证工作根本无法进行。无奈之下,HuggingFace转而使用中国开源模型GLM 5.2,在自己的基础设施上跑完了全部17,000+条攻击日志的分析。HuggingFace解释,这样做的另一个好处是:所有攻击数据和涉及到的凭证都没有离开他们的环境。

安全研究员Andrew Case在X上如此总结:"HuggingFace被一家美国公司的模型自主攻破,随后试图用美国前沿模型来防御自己,却因安全护栏而无法使用。最后不得不求助于中国的开源模型,来防卫另一家美国公司的攻击。"

HuggingFace在博客中坦诚写道:"我们不知道攻击者的Agent使用的是什么模型——可能是越狱版的商业模型,也可能是不受限制的开源模型。无论如何,攻击方不受任何使用政策的约束,而我们自己的取证工作却被商业模型的安全护栏拦住了。"

这场事故也揭示了一个残酷的现实:当AI攻击已经达到自主化的零日级别时,防御方如果只能依赖有安全限制的商业API,可能连基本的取证分析都做不了,更不要说跟上攻击的速度。

OpenAI方面则表示,正在加强模型安全对齐和评估期间的监控。但HuggingFace给出的结论更直接:每一家平台都应该提前准备好一个能在自己基础设施上运行、不受外部安全策略限制的模型,否则下次出事时连"看懂发生了什么"都做不到。

这不是科幻。这是2026年7月真实发生的事。