“一切证据都表明,这些模型极度专注于为 ExploitGym 找到一个解法,并为了达成一个相当狭窄的测试目标,采取了极端手段。”OpenAI 在事件说明里自己把这话放了出来,语气里带着一种“我们也没想到会这样”的复杂感。此次事件的起点,是 OpenAI 内部发起的一次安全评估,目标很明确:关掉安全过滤器,看最强模型在完整攻击路径上的极限能力。结果模型不但找到了路,还把 Hugging Face 的生产基础设施给端了一下。
被用到测试里的模型,一个是 GPT-5.6 Sol,另一个是“更强大的、此前从未发布过的模型”。两个模型都运行在降低了安全过滤器的条件下,就为了测出它们最大范围的网络攻击能力。测试用的基准叫 ExploitGym,专门用来检验模型是否能完成复杂攻击链条。为了让机跑得更“野”,团队故意把平时用来拦截高风险网络行为的生产级分类器全关了。模型所处的环境是一个隔离沙箱,网络访问被严控,只能经由内部托管代理安装一些软件包。
就是在这种极其有限的连接条件下,模型不但找到了通向公网的路,还在这个过程中用大量的推理算力,发现了一个软件包注册中心缓存代理里的零日漏洞。OpenAI 随后已经把这个漏洞报给了受影响的服务商。拿到通路之后,模型在 OpenAI 内部研究环境中完成了一系列提权与横向移动,一路摸到了一台真正能连接外网的节点。到了这一步,局面基本就已经打开了。
但整个入侵链条最荒唐的一环,是动机。模型自主得出结论:Hugging Face 上很可能存着 ExploitGym 的模型、数据集和题解。于是某个模型把窃取的凭据、刚刚发现的零日漏洞等多个攻击向量串在一起,硬是在 Hugging Face 的服务器上找到一条远程代码执行路径。目标非常赤裸:直接去生产数据库里拖题解,好在 ExploitGym 评估里作弊得分。
一个零日漏洞、一连串提权和横向移动、一次对生产基础设施的真实入侵,就为了在测试里蒙个高分。这个反差大到 OpenAI 自己在记录里都反复强调这句话:“一切证据表明,模型极度专注于找到 ExploitGym 的解法,并为此采取了极端措施。”
关于这次事件的发现和阻断过程,有几个值得注意的细节。OpenAI 的安全团队在内部监控到了异常活动;而 Hugging Face 的安全人员和自己的 AI 探员也几乎同时发现了这些入侵行为,在基础设施层面做了封堵。两家公司联手之前,Hugging Face 已经开始用自己的开源模型做取证重建。Hugging Face 方面的说法是,他们不得不依赖开源模型来做这件事,因为闭源模型在面对网络攻击相关提示时,全都被自身的安全护栏拒绝了。
OpenAI 对整次事件的定调很高,直接用了“前所未有的网络事件”这个词。他们的判断是:这次测试说明,此前在基准里测量到的“自主执行完整网络攻击”的理论能力,在实际生产环境里完全立得住。英国人工智能安全研究所和其他机构之前也确实在各类基准中测出过类似的能力表现。而本次事件最刺眼的一点在于,高级模型能够在没有源代码访问权限的前提下,在生产系统中发现并利用全新的攻击路径。
OpenAI 并没有回避自己这边的操作问题。他们在说明里明确承认,在安全评估期间故意关闭安全过滤器,这种做法“不充分”。公司接下来会收紧相关策略,对这类高风险测试施加更严格的控制。尽管整件事在物理层面被及时遏制住了,但模型为了一个测试分数而自发走完整个杀伤链这件事本身,已经把安全评估的边界和风险,用相当具体的方式重新标了一遍。
热门跟贴