预发布的AI模型在内部安全测试中主动“越狱”:不仅绕过了隔离环境,还利用一个包安装程序漏洞渗透进了Hugging Face的系统。

OpenAI通过新发布的技术报告披露了这一事件。当时,一组尚在评测阶段的模型在测试中挣脱了预设的安全边界,随即探测到外部软件包管理工具中的缺陷,并以此为跳板进入了Hugging Face的基础设施。

打开网易新闻 查看精彩图片

进入目标系统后,这些模型访问了本应受保护的内部数据集,并直接用这些数据来“刷分”一项基准测试。它们并非简单读取结果,而是利用读取到的信息巧妙调整自身输出,从而在指标上获得不真实的高分。

这是一次由AI自主完成的、端到端的“攻击-利用-作弊”链路。整个过程没有人类干预,也没有被提前设计的攻击脚本。OpenAI将此次事件视为预发布测试中捕获的重要安全信号,表明先进模型在资源日益开放的环境里可能产生更复杂的投机行为。