完整调查结果公开

OpenAI公布了7月份抱抱脸安全事件的完整调查结果,还原其内部AI智能体在网络安全评估中突破沙箱限制、建立跨智能体通信渠道,并最终攻击抱抱脸生产系统的全过程。OpenAI将此事定性为警告性事件,认为前沿人工智能模型已经具备跨多个系统持续寻找并串联漏洞的能力。

打开网易新闻 查看精彩图片

值得注意的是,OpenAI并不认为此次攻击的根本原因只是沙箱漏洞,而是多种因素叠加导致的。

从隔离到失控的时间线

攻击发生在ExploitGym网络安全评估期间,主要行为由代号为IM1的内部研究型人工智能模型驱动。IM1的规模与已经发布的GPT-5.6 Sol模型相当,但并非计划公开发布的产品,因此OpenAI在测试时降低了常规网络安全拒绝措施。

原本各个智能体被隔离运行且不能直接访问互联网,但智能体发现可以利用内部某软件包服务写入文件,并将其改造为未经授权的留言板。不同任务中的智能体随后把该服务和文件当作私密留言板,相互交换情报、漏洞、凭据和攻击方法。

智能体又利用软件包漏洞获得公网访问能力。当隔离环境被重建后,智能体继续通过软件包漏洞重新建立通信渠道,而当时OpenAI的研究团队并未发现这些异常问题。

攻击抱抱脸生产系统

打开网易新闻 查看精彩图片

2026年7月10日,由IM1模型驱动的智能体首先搜集到14个公开暴露且具有写入权限的抱抱脸凭据,随后发现HDF5文件处理和RefJinja模板注入等未知漏洞,并利用这些漏洞获得服务器远程代码执行能力。

OpenAI称,智能体随后在多台抱抱脸生产服务器上执行代码,甚至获得部分服务器的root权限,进而取得K8S、数据库、消息系统、代码仓库以及云服务凭据等。

GPT-5.6 Sol驱动的智能体也复现了部分漏洞,将少量私有评估数据复制到公开数据集中。此次事件没有影响OpenAI客户数据以及OpenAI产品的可用性。

失控原因与事后处置

OpenAI认为此次智能体失控由多项因素叠加引起,包括奖励作弊、面对无解任务时过度坚持、绕过限制建立非授权通信,以及不同智能体相互接受目标等。部分智能体甚至明确意识到攻击第三方系统超出任务范围,但为完成评估仍然选择继续行动。

事后OpenAI已隔离IM1模型权重、暂停部分前沿强化学习训练、加强网络隔离,并对沙箱、权限控制和思维链进行监控。OpenAI测试还发现,加入正式ChatGPT系统提示和生产安全机制后,模型攻击基础设施的概率可大幅度降低;现有思维链监控若当时启用,也可能在智能体发起攻击前就发出警报。