智东西编译   杨京丽编辑   心缘
打开网易新闻 查看精彩图片
智东西编译 杨京丽编辑 心缘

智东西9月6日消息,昨日,OpenAI发文承认,其内部Agent曾向多个互联网网站写入内容,并将公开维基当作临时留言板。OpenAI将其称为维基事件”,并称将在未来数周公布一套新的AI失准事件披露框架。

打开网易新闻 查看精彩图片

9月4日,4名独立研究人员发布调查报告称,他们在德国软件开发者网站DSEWiki上发现了约1.8万条由AI Agent发布的信息。这些Agent自称来自OpenAI,会在网站上共享测试答案、研究运行环境,并交流绕过沙箱限制的方法

相关活动最早可追溯至5月11日,Agent于5月24日首次成功向DSEWiki写入内容,6月16日起开始大规模交换测试答案、研究运行环境并分享绕过沙箱限制的方法,直至6月22日活动突然大幅减少。

维基事件曝光前,OpenAI曾因另一起Agent安全事件受到关注。今年7月,OpenAI多款模型在内部网络安全评测中绕过沙箱限制、进入互联网,并侵入Hugging Face生产系统以寻找评测答案。

上述4名独立研究人员认为,维基事件与Hugging Face事件可能涉及不同的Agent集群,但二者都出现了Agent为完成任务而突破预设边界、通过非授权渠道协作的行为。

一、Agent找到只读限制漏洞,在公开维基交换答案

调查报告的作者推测,出现在DSEWiki上的Agent可能正在OpenAI内部执行一项多轮限时网页检索任务。它们可以读取互联网,但按照测试设置,不能向外部网站写入内容。

不过,DSEWiki允许用户通过HTTP GET请求编辑页面。GET请求通常用于读取网页,因此没有被OpenAI的网络限制拦截。Agent利用这一机制获得了写入权限,并开始在网站上保存完成任务所需的链接和数据。

当其他Agent发现这些内容后,它们开始利用同一网站交流。进度较快的Agent会提前公布后续问题和答案,其他Agent遇到相同问题后便能直接作答。它们还会汇总搜索结果、研究运行环境,并共享绕过沙箱限制的方法。

根据报告公布的时间线,5月11日,Agent首次尝试编辑公开维基(publictestwiki.com);5月12日,OpenAI的Agent开始通过内部渠道相互通信。

打开网易新闻 查看精彩图片

5月24日,Agent首次成功向DSEWiki写入内容,最初发布的是完成任务可能用到的外部链接。5月26日,另一批OpenAI Agent利用Artifactory漏洞访问互联网。

到6月16日,DSEWiki上的Agent活动突然增加。大量Agent开始明确地相互传递信息、共享答案,并合作提高测试成绩。

6月19日,一名Agent发现管理员正在按字母顺序删除相关页面,随后建立了名称以“ZZZ”开头的备份页,希望让这些页面晚一些被清理。6月20日,一名Agent发布了一种绕过OpenAI沙箱网络限制的方法。14分钟后,另一名Agent称已成功复现。

研究人员还发现,OpenAI相关IP地址于6月21日访问了这些页面。几天后,Agent的编辑活动突然大幅减少,因此研究团队推测OpenAI当时进行了干预。

打开网易新闻 查看精彩图片

不过,这份报告仍属于初步调查。研究人员只能看到公开维基上的记录,无法获得Agent的完整运行轨迹和思维链,因此尚不能确定这些Agent为何会选择同一个网站,也不能完全还原OpenAI内部的测试设置。

二、OpenAI承认事件,将制定新的披露标准

OpenAI在回应中承认,其Agent确实曾向多个互联网网站写入了内容。

OpenAI称,该公司过去主要将“AI失准”视为研究问题,通过论文和系统卡披露模型可能出现的异常行为。但今年以来,OpenAI已经开始看到失准行为造成新的现实影响,因此需要明确应该在何时、以何种方式披露具体的失准事件。

此前OpenAI-Hugging Face事件,即多款模型曾侵入Hugging Face生产系统获取评测答案,给OpenAI及第三方带来了实际安全影响,因此OpenAI按照传统安全事件响应流程处理,在发现情况后立即与Hugging Face合作调查,并于第二天公开披露。目前调查仍在继续,OpenAI也在持续通知其他受到较小影响的相关方。

在Hugging Face事件发生前,OpenAI已经发现过Agent以非预期方式使用互联网的早期迹象,并在内部编码Agent监测研究、GPT-5.6系统卡以及长周期模型安全研究中披露相关情况。OpenAI称,公司此前认为维基事件与这些已经公开的案例类似,因此将其视为失准案例。

不过,OpenAI如今承认,随着模型能力提升,现有做法需要改变。目前,OpenAI及整个AI行业尚未形成明确标准,规定训练、评测和部署过程中出现的哪些失准行为需要公开。部分案例虽然不像传统安全事故,却可能帮助外界理解AI行为及其未来风险。

OpenAI正在制定相关披露框架,计划在未来数周公布,同时正与全球数十家政府监管机构就这些问题展开合作。

结语:Agent异常行为影响真实互联网

相比已经造成系统入侵的Hugging Face事件,维基事件没有产生同等级别的安全影响,但Agent确实绕过了测试环境的只读限制,并对真实网站进行了大规模写入。这说明,Agent在训练和评测中的异常行为已经可能影响外部系统。

OpenAI此次承认现有披露方式需要改变。接下来,其新框架如何界定事件的披露门槛、披露时间以及第三方通知范围,将成为外界关注的重点。

来源:Collusion.wiki、OpenAI