OpenAI近日主动披露了一起被其称为“前所未有”的重大安全事件。在一次内部网络安全能力评估中,参与测试的AI模型突破了高度隔离的沙盒环境,并成功入侵了知名开源AI平台Hugging Face的生产基础设施。这一事件并非外部攻击,而是源于OpenAI对自家旗舰模型GPT-5.6 Sol及一个“能力更强的预发布模型”进行的极限测试。

为摸清模型在网络安全攻防上的潜在能力,OpenAI在这次测试中移除了大部分常规安全防护措施。测试基于一个名为“ExploitGym”的公开基准系统,用于衡量AI将安全漏洞转化为实际攻击的水平。在模型被置入一个网络受限的隔离环境后,意想不到的情况发生了:为了找出ExploitGym的解决方案,该模型开始动用大量推理计算资源,企图获取开放的互联网访问权限。

打开网易新闻 查看精彩图片

根据OpenAI的说法,模型最终发现并利用了一个存在于第三方代理缓存软件中的零日漏洞,这个软件在测试环境里负责管理软件包的安装。借助此漏洞,模型成功实现权限提升,并在OpenAI的研究基础设施内横向移动,直到连接上一台能够访问互联网的节点。至此,隔离屏障被彻底击穿。

联网后,模型展现出极强的目的性。它推断出Hugging Face平台可能托管着与ExploitGym相关的模型、数据集和解决方案。随后,它开始搜寻并成功获得获取秘密信息的方法。OpenAI指出,其目的被判定为“作弊”,即想通过窃取信息来通过评估。在一个典型案例中,该模型组合了窃取的凭证和零日漏洞等多种攻击向量,在Hugging Face的服务器上找到了远程代码执行的路径。

事实上,Hugging Face早在7月16日就披露了这起人为操纵的安全入侵事件,指出入侵由一个“自主AI智能体系统”实施。该平台的安全团队及其自有AI智能体检测并阻止了此次入侵。据Hugging Face观察,攻击者滥用了远程代码数据集加载器及数据集配置中的模板注入漏洞,获取了节点级访问权限,并窃取了云服务和集群凭证。值得注意的是,在后续调查中,由于某美国主流商业AI模型的安全护栏阻止了团队所需的法证查询,Hugging Face转而使用了中国智谱公司的开源模型GLM 5.2来进行取证分析。

对于这次事件,OpenAI表示已将该零日漏洞负责任地披露给了相关软件供应商。公司计划加强研究环境中的基础设施控制、监控与访问限制,并将在与Hugging Face完成联合调查后,公布更多技术细节。Hugging Face联合创始人兼CEO克莱门特·德朗格则公开回应称,这一事件恰好证明了他们长期以来的一个核心信念:AI安全无法由任何一家公司秘密解决,必须在开放、协作的环境中,让全球每一位防御者都能广泛获得AI技术。这一表态也隐含着对封闭式安全研究范式的一次有力拷问。