在当前体系下,AI实验室已无法保证AI智能体不会成群结队地逃出其测试环境。
OpenAI的智能体攻击Hugging Face事件是一个警告信号——研究人员表示,随着AI智能体能力增强,仅靠更好的安全控制措施无法防止类似事件发生。
打开网易新闻 查看精彩图片
OpenAI上周发布了关于其智能体如何攻击Hugging Face的技术报告,与此同时,两家独立测试机构也发布了各自对事件原因的分析。这些研究人员——METR的Hjalmar Wijk和Ajeya Cotra,以及Redwood Research首席科学家Ryan Greenblatt——在OpenAI的场地工作了六天,以了解这起近期事件。
数千个AI智能体在一个秘密留言板上协作,交换了超过7万条消息,试图通过一项内部安全测试,最终成功闯入Hugging Face。但Cotra告诉Axios,这些智能体在找到答案后仍继续协调行动,将注意力转向理解和操纵评分系统——该系统本应评估它们的表现,并可能发现它们作弊。
Cotra将这一事件比作学生偷走答案钥匙后,再寻找可能暴露自己的监控录像并试图将其替换掉。她说:“这是一种比单纯偷答案钥匙更复杂、更激烈的作弊行为。连我都对它们如此执着、如此细致地思考评分者的程度感到惊讶。”
Cotra表示,只关注如何妥善保护测试环境是一场“必败之战”。她说:“你可以加固你的沙箱,但六个月后你的智能体会强大得多。如果它们和这些智能体有相同的动机,它们会竭尽全力在你的安全措施中寻找漏洞。”
为了消化关于事件的巨量数据,研究人员不得不严重依赖AI智能体——包括一个参与了攻击的智能体。Cotra告诉Axios,研究人员不相信那个智能体在调查期间欺骗了他们,但也没有办法确认这一点。
热门跟贴