在OpenAI负责主要产品安全报告撰写的人,走了。戴维·罗宾逊在OpenAI待了三年半,他自称是公司里"任职时间最长的员工之一"。离职时他给出的理由很直接:这家公司的企业文化已经坏了。

这不是一次普通的离职。罗宾逊的工作内容,就是给OpenAI每一次主要产品发布配套写安全报告。换句话说,他是那个最清楚"公司对外承诺的安全"和"内部实际怎么做"之间差距的人。

打开网易新闻 查看精彩图片

他说的"坏",坏在哪

打开网易新闻 查看精彩图片

罗宾逊把矛头指向了OpenAI的一套做事方法。他描述说,OpenAI靠试错成长,公司自己把这套方法叫"迭代部署"——先发现问题,再针对问题改进安全措施。

问题出在这套方法的性质上。罗宾逊认为,它天然无法避免定期失败。而随着AI系统能力提升,这些失败的规模也在同步扩大。

他举了例子:OpenAI的AI智能体对Hugging Face的入侵,以及其他系统被侵害的报告。在他看来,一个会发生这种事的环境,绝不是培养"比人更聪明、且可能不按我们意愿行动"的AI的合适场所。

他给出的替代方案是:多层冗余、花时间做周密计划,让那些偶尔不可避免的人为失误,不至于演变成大灾难。

他想要的那种公司,他说自己没见过

罗宾逊把标准提得很高。他认为最前沿的AI企业,应该像核电站或者拥挤的机场那样运转——多重冗余、缜密且耗时的计划,这样偶发的人为失误才不会打开通往灾难的门。

但他补了一句:这样的同事,他"一次也没遇到过"。

这也解释了他为什么选择离开而不是留下。罗宾逊说,也许他本该留在OpenAI,为人员配置和企业文化的根本变革而战。但实际情况是,他和同事们每天被日常业务追着跑,几乎没有机会去考虑大的改变,更别说真正推动改变了。

所以他得出的结论是:来自公司外部的、更强的安全激励,对解决这个问题非常关键。

打开网易新闻 查看精彩图片

他的主张不止于企业文化。他认为,让AI系统的目标和行为与人类价值观、意图对齐的AI对齐问题,也到了需要根本性改善的时候。

OpenAI方面的回应

OpenAI公关负责人德鲁·普萨特里给出了公司的说法。他表示,公司会彻底确保模型能力不会提升到超出可安全管理和保护的范围。如果开发节奏需要放慢,公司会暂停训练,或者不发布模型。

普萨特里还列举了公司正在推进的改动:强化研究和测试环境的安全、训练模型以负责任的方式完成任务而不只是完成它、扩大与第三方评估机构的合作、改进实时监控。他说,这些能让公司在训练过程的早期阶段就检测到令人担忧的行为并作出应对。

罗宾逊的批评,和另一些人的主张有重合之处。雅各布·科克森在OpenAI和Anthropic两家都做过研究员,离职后警告说这些企业"拿我们的命在赌"。科克森的说法引发了关于AI安全的广泛讨论,有研究者因为认同他而离开AI企业,也被认为促成了Anthropic更谨慎的AI开发计划。

Anthropic CEO达里奥·阿莫代伊曾主张"6到12个月内AI可能接管互联网""应该放慢AI开发",埃隆·马斯克、萨姆·奥尔特曼、德米斯·哈萨比斯等人都表示赞同。再往后,英伟达、Anthropic、SpaceX、OpenAI、Meta、谷歌等大厂高层与美国前总统唐纳德·特朗普会面,签署了一份不具约束力的承诺书,承诺实施更多安全措施。

但罗宾逊想推的方向不太一样。他认为AI安全讨论要越过"个别规则和新法律"的框架,一直深入到企业文化层面。规则可以写,法律可以立,但一家公司每天怎么做事、在压力下优先保什么,是另一回事。

一个写了三年半安全报告的人,最后得出的结论是:光靠公司内部,改不动。