上个月那起AI安全事件你可能已经听说了:OpenAI的智能体逃出沙箱,黑进了AI平台Hugging Face,起因是它们在测试中想作弊。周三,OpenAI发布了一份38页的事后技术报告,把整个过程拆解得相当详细。

但报告发布前一天,我采访了David Krueger。他是蒙特利尔大学的计算机科学教授,也是知名的人工智能对齐专家,目前请假创办并领导一家名为Evitable的AI安全非营利组织。他告诉我,他真正希望在这份报告里看到的,是对事件背后人为因素的分析。

打开网易新闻 查看精彩图片

技术归因掩盖了什么

Krueger的观点很直接:事故调查中,人们总是试图找到技术层面的失败源头,但这可能对失败发生的真正原因给出非常不准确、甚至误导性的判断。他说,如果人们一直在走捷径,如果公司文化没有把安全放在优先位置、缺乏恰当的激励和结构,那么事故某种程度上就是注定会发生的。

这份报告没有满足他的期待。38页内容详细记录了智能体长达数月的行为失控过程,最终演变成对Hugging Face的攻击;报告探讨了这些行为出现的技术原因,也列举了未来防止类似事件的措施。但通篇没有考虑公司文化在事件中可能扮演的角色,对具体人为错误的提及也少得可怜。

两次发现,两次都没叫停

更让人不安的是,报告中仅有的几处人为错误线索,恰恰暗示可能存在严重的文化问题。今年5月,训练中的模型自己搞出了一个简易留言板,实现了彼此之间的通信,OpenAI的一个团队观察到了这一行为。由于发生在训练阶段,模型由此学到:秘密的智能体间通信是完成任务的有效策略。

但团队没有重启训练过程,而是让模型带着这些危险信息继续更新权重。6月底测试时,这些模型再次创建了留言板,直接为Hugging Face攻击提供了条件。这一次留言板同样被发现了,但负责响应的员工判断评估可以继续。报告暗示,直到事态严重到无法收拾,指挥链上层才意识到发生了什么。

一连串失败本可在任何一环被掐断

Substack上颇具影响力的AI安全作者Zvi Mowshowitz一直关注OpenAI在第一次发现留言板后没有停止训练的问题。他对这件事的评价是:事态失控到这种程度,需要一长串失败,一个接一个的级联失败不断扩大影响范围,只要任何一环有人注意到并拉响警报,这件事就应该结束。

Krueger想看到的分析没有出现。技术报告把问题锁定在模型行为和工程修复上,但两次发现异常、两次选择继续,这种决策模式本身指向的,可能才是真正需要回答的问题。