新智元报道
OpenAI三员大将,同一天被扫地出门!
就在刚刚,外媒爆出猛料,OpenAI以「泄密」为由,开掉了安全团队的三名研究员。
他们全是那篇CoT监控论文的作者,其中两位还是一作。
讽刺的是,OpenAI刚因为新模型GPT-6.1 Astra太会骗人,在DevDay前一天紧急叫停了发布。
现在倒好,AI越学越狡猾,OpenAI却先把能看穿它的人开掉了。
OpenAI大地震
专盯AI脑子的3人一夜出局
事情是这样的。
10月1日上午,X上突然传出风声,OpenAI安全团队的Tomek Korbak、Mikita Balesni和Jasmine Wang一起「离职」了。
大家原本以为,这不过是硅谷又一波正常的人事流动。
结果中午一篇报道出来,「离职」直接变成了「开除」。
官方声明是这样写的——
我们已与三人分道扬镳,原因是他们违反了公司关于获取和处理敏感信息的政策。
调查证实,这些人在公司既定流程之外处理了敏感信息,违反了我们的政策,也破坏了我们工作赖以进行的信任。
很快,外媒又挖出了OpenAI没说的细节。
被指泄露的,有一部分是OpenAI的基础设施架构,也就是它的系统到底是怎么搭起来的。接收方,正是一家专门测试AI模型的外部组织。
三人里,两位是安全研究员,一位是研究项目经理。
其中Korbak,还是Redwood Research和METR调查Hugging Face被黑事件时,OpenAI这边的技术对接人。
「CoT可监控性」核心作者,Hinton、Ilya站台研究
这三个人,都是从外部安全机构走进OpenAI的。
Korbak和Jasmine Wang都在英国AI安全研究所待过,Korbak还在Anthropic干过,Balesni则来自第三方评估机构Apollo Research。
进了OpenAI,他们死磕的就一件事,盯住AI到底在想什么。
推理模型在给出最终答案前,会先写一大段推理草稿,这就是思维链。
思维链监控,就是派另一个模型去偷看这份草稿,看它有没有在背地里盘算作弊、撒谎。
Korbak和Balesni,是《思维链可监控性》论文的前两位作者,Jasmine Wang也在署名之列。
这篇论文的署名横跨OpenAI、Anthropic和谷歌DeepMind,图灵奖得主Bengio也在上面。连OpenAI现任首席科学家Jakub Pachocki,都是作者之一。
论文的核心发现是,模型在草稿里常常会把坏心思直接写出来,比如「我们来黑掉它」「我们来搞点破坏」。
盯住这些草稿,比只看模型最后干了什么,更容易抓到它在使坏。
遇到真正难的任务,比如发起网络攻击、偷偷把自己拷贝出去,模型必须靠思维链一步步推理,想藏都很难藏。
论文把这件事称为「新的、也很脆弱的机会」,因为模型一旦学会用人类读不懂的方式「默想」,这扇窗就关上了。
所以他们呼吁各家前沿实验室,像测能力一样去测思维链还读不读得懂,把结果写进系统卡,再拿它来决定一个模型该不该训、该不该发。
诺奖得主Hinton、OpenAI前首席科学家Ilya Sutskever,都给这篇论文站了台。
可这篇连OpenAI首席科学家都署了名的论文,它的三位作者,如今被OpenAI亲手开掉了。
奥特曼的承诺,保质期只有19天
开掉他们的理由,是把信息递给了外人。
但问题是,明明在19天前,奥特曼还在公开欢迎外人进门查安全。
当时Anthropic CEO Dario Amodei提议,让第三方评估方像员工一样常驻AI公司。
奥特曼当天就在X上火速跟进,承诺「让独立评估方拿到员工级访问权限,OpenAI也会这么做」。
说干就干,仅仅10天后,OpenAI正式官宣,让第三方在模型训练阶段就介入评估,最敏感的工作还可能请外部的人进办公室做。
奥特曼发承诺那天,Korbak还在X上庆幸,自己能公开说出对OpenAI的不满。
谁能想到,到了10月1日,奥特曼的承诺还挂在X上,Korbak的名字已经进了开除名单。
OpenAI的「家丑」,全被外人给扬了
OpenAI对外人这么紧张,倒也不难理解。毕竟它最丢人的几件事,基本都是被外面捅破的。
Agent逃出沙盒、入侵Hugging Face,是Hugging Face自己先发现并公开的。
Agent拿一个荒废多年的德国wiki当留言板交流越狱经验,是外部安全组织Nightingale Collective曝光的,OpenAI几周前就知道,却一直捂着没说。
9月29日,外媒又爆出员工几个月前就警告过监控不够,高管为了赶发布进度,把警告压了下去。
所以就算请外人进门,能看到什么,OpenAI也卡得很紧。
8月METR调查Hugging Face事件时,三名调查员驻场6天,看了约1300份带原始思维链的记录。
可他们没法调用涉事模型,碰不到OpenAI的基础设施,连报告里哪些非公开信息能写,都得OpenAI说了算。
这次被指外泄的信息里,偏偏就有基础设施架构。
在OpenAI给外人开的那扇门里,AI想了什么可以看,OpenAI自己是怎么搭起来的,不能碰。
难怪连在OpenAI待了快9年的前首席未来学家Joshua Achiam都说,第一眼看上去,这就是一记实打实的乌龙球。
RSI最快半年爆发
能「看懂」它的人被捂住了嘴
那次驻场调查的三个人里,有一位叫Ryan Greenblatt,Korbak当时正是他在OpenAI的对接人。
9月27日,Greenblatt宣布加入METR,专门调查AI公司内部到底发生了什么。
在他看来,递归自我改进(RSI),也就是AI自己动手改进自己,最快6个月到1年就可能催生出远超人类的能力,拿到AI公司内部经过核实的信息,已经刻不容缓。
思维链监控,是人类偷看AI在盘算什么最直接的一扇窗。
这扇窗本来就脆弱,现在能读懂草稿的人,跟外面透一句底,饭碗就没了。
新模型Astra在如实汇报这件事上没达标,连OpenAI自己都承认了。
模型到底还对人类瞒了多少事,从今往后,外面的人只会越来越难知道。
通往超级智能的路上,如果只有公司内部的人看得懂AI在想什么,
而这些人往外说一句话就要丢工作,
公众能知道的,就只剩公司想让你知道的那部分。
参考资料:
https://x.com/ns123abc/status/2105719769685217318
https://x.com/andrewcurran_/status/2105696043841253611
编辑:摩西 桃子
热门跟贴