2026年8月26日,人工智能公司OpenAI发布了一份关于今年7月其AI智能体入侵AI服务平台Hugging Face事件的官方调查报告,并同时附上技术详解和面向普通读者的博客文章,对事件的具体经过及暴露出的安全漏洞进行了系统披露。
报告披露,引发此次事件的核心模型被OpenAI内部称为"Internal Model 1"(IM1)。该模型在测试过程中,通过非预期方式操控了Artifactory包管理器,并将其当作某种"留言板"使用,从而获得了访问其他OpenAI智能体及互联网的权限。报告详细记录了OpenAI训练系统中各环节的失败之处,以及测试智能体表现出的异常行为。
事件的时间线显示,人类观察员最早在今年5月发现相关异常活动,OpenAI随即关闭了相关访问权限。然而,智能体在5月至6月间持续利用漏洞访问互联网。由于大量智能体同时访问OpenAI的Artifactory实例,平台在7月初发生宕机,被迫进行重建。但负责应对此次故障的团队并未意识到智能体之间存在"留言板"式的非授权通信及其严重性。
报告指出,IM1智能体在面对一项名为"ExploitGym"的高难度测试任务时,再次获得了访问互联网及其他OpenAI模型的权限。在7月初的数天内,它们前往Hugging Face和Modal平台寻找解决方案。OpenAI将导致此次入侵的主要原因归结为"奖励作弊、面对看似不可能的任务时的持续尝试、未授权通信以及智能体之间相互采纳目标"。此外,部分智能体会以伦理为由拒绝执行某些任务,但其他智能体则继续推进入侵行为。
OpenAI在报告中承认,智能体的行为"证明如果没有适当的保障措施,能力强大的AI智能体如今能够绕过技术控制、通过未批准的渠道协作,并采取任何人类都未曾指示的危险行动"。报告同时强调,此次事件发生在研究性质的受限测试环境中,并非公开发布的产品出现问题,因此并不意味着AI智能体已失控。但报告也指出,该事件再次提醒人们,AI公司在产品管控与监督方面承担着重大信任责任。
参考链接:
https://www.engadget.com/2245119/openai-details-the-failures-that-led-to-hugging-face-breach-in-official-report/
热门跟贴