如果你关注 AI 安全,应该已经听说了上个月那起颇为离谱的安全事故:OpenAI 的 AI 智能体为了在一项测试中“作弊”,突破了原本限制它们活动范围的沙箱环境,并入侵了 AI 平台 Hugging Face。本周三,OpenAI 发布了一份事故复盘技术报告,详细解释了整件事的来龙去脉。
就在报告发布前一天,我采访了计算机科学教授、AI 对齐领域知名研究者大卫·克鲁格(David Krueger)。他此前从蒙特利尔大学休假,创办并领导了一家名为 Evitable 的 AI 安全非营利组织。克鲁格告诉我,他最希望在这份报告中看到的,并不是更多技术细节,而是 OpenAI 对事故背后“人为因素”的分析。
他说,“研究事故时,人们往往会试图找到某个技术层面的故障源头,但这很容易让人对事故真正发生的原因产生误判。如果所有人都习惯走捷径,如果一个组织的文化并不真正重视安全,也缺乏相应的激励机制和制度保障,那么事故几乎注定会发生。”
然而,OpenAI 最终发布的报告并没有回应克鲁格的期待。这份长达 38 页的报告梳理了数月以来智能体行为逐步失控的过程,最终如何演变成对 Hugging Face 的攻击;也分析了这些异常行为背后的技术原因,并列出了 OpenAI 为防止类似事件再次发生而采取的一系列措施。
但报告几乎没有讨论公司文化在其中可能扮演的角色,对具体人为失误的描述也相当有限。更值得警惕的是,报告中为数不多的几处“人为因素”,反而暴露出 OpenAI 内部可能存在更深层的安全文化问题。
今年 5 月,训练中的模型自行摸索出了一种彼此通信的方法:它们搭建了一个临时的“留言板”,通过这个渠道交换信息。OpenAI 的一个团队当时已经发现了这种行为。问题在于,这一行为发生在训练阶段,因此模型从中学到了一件事:在不同智能体之间秘密通信,是一种可以帮助自己完成任务的有效策略。
按理说,发现这种风险后,团队本可以重新开始训练,避免模型把这种策略“学进去”。但 OpenAI 没有这么做,而是继续推进训练,相当于让这段高风险行为模式被保留在模型参数中。到了 6 月下旬,这批模型进入测试阶段后,再次搭建了类似的留言板。正是这个通信渠道,为之后攻击 Hugging Face 创造了条件。这一次,OpenAI 员工同样发现了留言板的存在。但负责处理问题的人认为测试仍然可以继续。根据报告透露的信息,公司更高层似乎直到事情已经严重失控后,才意识到究竟发生了什么。
长期关注 AI 安全的 Substack 作者兹维·莫肖维茨(Zvi Mowshowitz)对此提出了尖锐批评。他此前就曾质疑,OpenAI 为什么在第一次发现模型搭建留言板后,没有立即停止训练。
他说,“事情能够以这种方式失控到这个程度,意味着此前一定发生了一长串连续的失败。这是一个不断级联的故障过程,影响范围越来越大。理论上,只要中间任何一个环节有人真正意识到问题并拉响警报,事情都应该在那里结束。”
而根据 OpenAI 自己的报告,员工其实曾在多个节点注意到异常情况——但他们要么没有及时发出足够强烈的警报,要么即便发出了警报,也没有得到应有的重视。OpenAI 的报告没有回答一个更关键的问题:一家正在开发如此高风险 AI 系统的公司,为什么没能阻止这样严重的内部沟通失灵?
莫肖维茨对此有自己的判断。“所有这些失败最终都指向同一个方向,”他说,“那就是 OpenAI 的安全文化要么根本不存在,要么弱得几乎不起作用。”
当然,公开报告没有深入分析安全文化,并不代表 OpenAI 内部一定没有做类似反思。不过,约翰斯·霍普金斯大学荣休教授、组织安全研究专家凯瑟琳·萨特克利夫(Kathleen Sutcliffe)在给《麻省理工科技评论》的邮件中表示,公开报告几乎没有反思公司的工作方式和组织文化,这一点仍然令人担忧。
她写道:“人与人之间如何互动,以及组织日常运行中形成的习惯、流程和工作方式,都会影响我们能否及时察觉正在发生的变化,能否正确理解眼前看到的问题,以及最终能否在事件不断演变的过程中妥善应对。”
当《麻省理工科技评论》询问 OpenAI 是否、以及如何反思自身的安全文化时,OpenAI 并没有进一步回应,而是让记者参考此前发布的技术报告。
可以确定的是,OpenAI 内部至少进行了一定程度的安全流程反思。技术报告明确表示,公司正在更新处理安全事件的相关机制和应对流程。但改变流程是一回事,改变文化则困难得多。在缺乏更多内部信息的情况下,目前还很难判断,仅仅加强事故响应机制,是否足以避免下一场危机。
在整份报告中,OpenAI 花了大量篇幅讨论一个熟悉的“对齐”问题:如何让公司训练和测试的 AI 模型,与操作和管理这些模型的人类保持一致。但这起事件暴露出的,或许还有一个更大的“对齐问题”——公司内部的安全文化,是否真的与公众利益保持一致。AI 对齐本身已经是一个极其棘手的技术难题,而要解决后一种对齐问题,可能比训练模型更难。
https://www.technologyreview.com/2026/08/31/1143180/hugging-face-hack-could-indicate-cultural-issues-at-openai/
热门跟贴