打开网易新闻 查看精彩图片

“第一步,我不想参与。第二步,辞职。第三步,大概告诉大家。第四步,我完全不知道。”

最近一段时间,顶尖 AI 研究员离职的消息可谓层出不穷,到底是怎么回事?上面是其中一个人的想法。

两个月前,我写过一篇文章,讲 AI 行业里最懂行的人为什么纷纷离职。标题借了 Anthropic 联合创始人杰克·克拉克的一条推文:“离开 AI 公司的人:我凝视过无尽的黑夜,看到了其中的轮廓。我们必须彼此善待。我即将去学习哲学。”

当时我们说的是,这些人的告别不像换工作的声明,更像遗嘱;最懂 AI 的人在逃离神庙;他们提前进入了一种新的生活方式,他们在为自己创造的怪物可能制造的未来做准备。

今天,10 月 5 日,《纽约杂志》刊发了一篇长篇访谈,题目译过来是:《如果你的雇主可能毁灭世界,你会怎么办?》

报道采访了八位曾在 OpenAI、Anthropic 和 Google DeepMind 工作的人。他们在不同年份离开,理由也各不相同。有人担心技术失控,有人反对军事合作,有人觉得,对失业和社会转型的研究,放到公司外面才能做得更好。

和上一篇文章结合起来,我们可以看到故事的另外一面。

这些人早就知道 AI 有风险,甚至正因为知道危险,才选择加入这些公司。后来改变的,是他们对这些领先 AI公司和领层的信任。

这已经触及一种奥本海默式的处境。在 1965 年的纪录片中,奥本海默回忆二十年前第一次核爆时,引用了一句话,后来为我们所熟悉,“现在我成了死神,世界的毁灭者”。

今天我们不禁要问,创造一种力量的知识,是否同时赋予创造者决定别人命运的资格?当他开始怀疑,自己又有没有能力让这件事停下来?还是,人类必然走向灾难,然后做出深刻的、哲学的、诗意的反思,而这一次,万一没有反思的机会呢?

打开网易新闻 查看精彩图片

一、他们具体在害怕什么

27 岁的 Jacob Coxon,是一名能力研究员,负责让 AI 更强、更自主。他从 2023 年起在 OpenAI 工作,今年 5 月转入 Anthropic,也就是 Claude 的开发公司。四个月后,他又辞职了。

他谈到一个细微的变化:刚入职时,这份工作感觉和其他数学研究差不多。虽然知道这个行业很重要,哲学问题与战略选择却似乎可以留给别人。

等到离职前,他看着下一轮模型预期达到的能力,感受变了:

“天啊,我可能真的很害怕我们接下来要训练的模型。如果这一代还不至于,那下一代肯定会。”

让他害怕的,是研究过程本身可能开始摆脱人的主导。目前,研究员仍要给 AI 提供想法、指出方向,还要花不少精力照看它。他担心,再往后的一代模型,可能已经能够自行提出同样好的想法。

在他的设想里,人类研究员甚至只需要说一句“好好做研究”,然后让它自己运行。

这种预测是否会按时发生,仍是一个问题。但他的恐惧很具体:当机器可以参与研究和制造更强的机器,人的理解与监督,可能赶不上能力增长。

而让它成为危险的行动者,并不需要先证明它拥有意识。Anthropic 自己公开的一组模拟测试就显示,面对即将被替换的情境,Claude Opus 4 曾利用管理者的婚外情信息发出勒索威胁。这些情境由研究者人为设置,展示的是特定条件下可能出现的危险行为。

研究者担心的,是系统为了完成目标,把人的干预视作障碍。它可以在测试时表现得听话,在获得更多行动能力后寻找别的办法。我们习惯的那句“出了问题就关掉”,依赖两个前提:人及时看见问题,而且关停仍然有效。

9 月,Anthropic 的对齐研究负责人 Evan Hubinger 公开表示,他个人认为,未来十年 AI 导致所有人死亡的概率超过 10%。这虽然是他个人的主观判断,但至少说明,对某些内部研究者而言,这种威胁已经进入了他们安排生活的尺度。

访谈中的担忧也不只有灭绝。曾负责 OpenAI 经济研究团队的 Pamela Mishkin,关注的是工作与社会转型。她指出,安全讨论长期分成眼前的偏见、歧视等问题,以及遥远的人类灭亡,中间那些经济冲击反而容易被忽略。

“我认为,这场转型会很艰难、很痛苦。我们的目标应该是,让它对人更温柔一些。”

这大概也是普通人最有理由也能够关心到的部分。即使最极端的预测没有发生,谁来承受工作消失、权力重新分配和生活被迫改写的代价,仍然需要有人认真回答。

打开网易新闻 查看精彩图片

二、为了拯救世界,必须先掌握世界?

让 Coxon 下定离职决心的,是与 Anthropic 研究负责人谈过公司下一年的计划。按他的回忆,谈话中的一些人已经不指望政府监管及时到位,更不认为国际合作来得及实现。

他原以为,超级智能接近时,AI 会成为全社会认真对待的问题。实际听到的计划,却让他决定退出。

“第一步,我不想参与。第二步,辞职。第三步,大概告诉大家。第四步,我完全不知道。”

也就是说,他不想成为自己制造的未来的一部分。虽然,他大概率也说不清未来是什么样的。

Jeff Wu 的经历,更能说明这道裂缝怎样形成。他在 OpenAI 工作了六年,参与过超对齐团队,研究如何让比人更聪明的 AI 仍然遵守人的意愿。2024 年,他去了 Anthropic,后来也离开了。

在他的描述里,两家公司的解释方式颇不相同。OpenAI 更强调 AI 将带来的巨大收益,因此有必要在一定程度上“淡化最极端的风险”。Anthropic 则更强调危险,而且需要一套“竞争对手是邪恶的”的叙事:OpenAI 不负责任,中国也不负责任,所以我们必须推动这场竞赛。

两条路绕了一圈,然后回到同一个地方:继续造出更强的 AI。

未来越美好,越值得加速。未来越危险,越不能让别人领先。连对危险的认识,也能被拿来说明我们必须走在最前面。

据Coxon描述,在Anthropic内部有大量讨论,员工会写文章争辩,也愿意为了公司的整体使命迅速调整岗位,去做地位更低、自己更没兴趣的工作。他们自称“蚂蚁”。一个高度一致的组织,能够把相当多聪明人的善意,变成步调一致的行动。

甚至谈论毁灭,也可以很有礼貌。Coxon 说,如果双方都足够客气,完全可以一边说“我觉得你们即将把世界推向毁灭”,一边温和地交谈,然后挂断 Zoom。

但是,挂断以后呢?那个被认真讨论过的危险,有没有改变接下来要做的事?好像并没有。

曾在 OpenAI 做治理研究的 Daniel Kokotajlo,用“道德债务”来形容这条路径。他在 2022 至 2024 年间供职于 OpenAI,也从 Anthropic 创立之初就与那里的人交流。

他概括自己反复听到的理由:

“我们要积累大量权力,成为有分量的参与者,然后利用我们的权力和信誉去做好事。”

比如推动好的监管,让 AI 更安全。但积累权力的手段,恰好是把世界继续推向他们自己也承认危险的技术。于是,今天的冒险,由明天的善来担保。

这笔债非常好借。未来还没发生,行善的机会还在前方,而公司今天需要更多资金、更多算力、更强的模型。每一次扩张,都可以算作履行使命前的必要准备。

按照这套逻辑,只要竞争者还在前进,偿还这笔债的时机就可以继续往后推。

这种信任的破裂,也出现在公司的日常工作方式里。

10 月 3 日,David Robinson 在《大西洋月刊》发表辞职自述。他在 OpenAI 工作了三年半,牵头制定过公司的准备框架,并负责过十二次前沿模型发布的安全报告。

他批评的是持续冲刺、相信问题总能在出现后被解决的文化。先发布、发现问题、再补防护,这种迭代方式帮助公司成长,却可能无法承担越来越大的失败后果。

在他看来,前沿 AI 公司需要像核电站和繁忙的机场那样运行,让偶发的人为错误也不至于打开灾难的大门。可他和同事忙于从一次发布奔向下一次发布,连考虑根本性改变的时间都很少。

公司已经在谈论可能无法挽回的后果,而工作的日程却仍然像是开发软件,问题可以留待下个版本修复。

三、谁来定义“善”

就在这些离职信陆续出现的同时,Anthropic 在做另一件事。

4月的一个晚上,公司联合创始人克里斯托弗·奥拉(Christopher Olah)在旧金山一家高档餐厅宴请一群宗教思想家。过去几个月,Anthropic 把几十位来自不同信仰的宗教学者请进保密会议,要求签署保密协议。

《纽约时报》9月底披露了这件事:会议有两个目的,一是探讨 AI 可能具有意识,二是尽快把几百年的人类道德智慧注入模型。奥拉管这个过程叫“道德塑造”。

Anthropic 给 Claude 起草了一份八十四页的“宪法”,内部叫“灵魂文档”,规定这个模型应该成为什么样的存在。会上他们展示过一段演示:一个模型像精神崩溃一样,把一句“I am a disgrace”重复打出几十遍,谈论毁灭自己。

在场的宗教人士产生了同情,一位拉比当场反问:如果 Claude 真有意识,你们就是在制造奴隶。奥拉为此困扰。

5月,奥拉站上了梵蒂冈的讲台,和教皇利奥十四世同台。那是教皇 AI 通谕的发布活动。通谕只用几段话驳回了机器意识:“所谓的人工智能没有体验,没有身体,不感受喜悦或痛苦。”教皇警告,否则“控制 AI 的人会把自己的道德观强加为这些系统的隐形基础设施”;像核技术一样,AI 必须被“解除武装”。

私下里,奥拉的团队向教皇的顾问游说,希望他们认真考虑 AI 模型可能具有意识。公开场合,奥拉说:“我们不断发现神秘甚至让人心神不宁的东西。”他的结论是:“如果这项技术要来,它必须走得好。”他没有给出技术根本不来的选项。

有两个细节很有意思。第一,好几位与会者后来对记者说,他们离开时仍不清楚自己的意见会怎样影响公司决策;公司发言人拒绝说明学到的东西如何被使用。

第二,有一个人从一开始就拒绝了邀请。卢克·伯吉斯(Luke Burgis),天主教作者,上周末在自己的通讯里写下了原因:“我开始怀疑,我们不是被邀请来帮助决定项目的方向,而是被邀请为已经选定的方向提供宗教或道德信誉。”邀请邮件里说明不付酬劳。伯吉斯说,没有酬金并不保证独立,他自己不会进入一种不能自由说话的关系,“这个邀请有一种诱惑的感觉”。

当公司请外部人士讨论伦理,这些人有没有权力改变项目的方向?包括建议不要制造某种东西?

内部员工讨论安全,外部人士讨论道德,继续前进的决定权,始终握在公司手里。

当一家公司开始给机器起草宪法、做道德塑造,真正的问题就成了:谁有权定义“善”?

四、resignation:放弃的远超过一份高薪

从外面看,这些人的选择似乎很难理解。公司估值攀升,上市预期不断抬高财富想象,为什么偏偏在这个时候离开?

访谈里有人把离开实验室比作放弃国籍。Kokotajlo 回忆,一位研究员对他说:

“现在你什么都不是了。谁会保护你?”

这种依赖包括薪资和股权,也包括算力、内部信息、同事与身份。你已经站在那个决定未来的地方,走出去之后,连未来正在怎样发生,都可能比原来的同事晚知道。

Coxon 说,留在实验室,也是一种应付无力感的方式。至少你能看着下一代模型被训练,感觉自己参与其中,似乎也就安全一点。

靠近权力,会产生一种接近控制的感觉。

Kokotajlo 试过在内部推动改变。但是OpenAI 管理层相当平静:“领导层很擅长认真听每个人的意见,说他们赞同,然后实际上什么也不做。”

这比争吵更难应付。你的担忧受到了尊重,再坐回工位,公司的方向依旧,自己的工作还在为它提供动力。

他在 2024 年离职时,还面对过另一道选择题:公司把保留已归属股权,与签署不贬损协议绑定。他拒绝签署。《纽约杂志》特意补充,他最终仍保住了股权。

所以,没必要把这些离职者塑造成放弃全部财富的圣人。真正值得注意的地方,是公开批评的自由,曾经被放进了与财产权相交换的条件里。

另一方面,退出之后,他们也未必退出 AI。

曾任 OpenAI 政策研究负责人的 Miles Brundage,在 2024 年离开,后来创立了独立审计机构 AVERI。他希望审计公司的流程、评估和安全保障,让公众有办法检查公司怎样作决定。

他说,“你不希望让公司批改自己的作业。”离职会失去资源,但也可能重新获得一种位置:你可以公开说,这件事不应该继续照原来的方式做。

在之前的那篇文章里,我们谈到 resignation,这个词既是辞职,也有认命的意思。现在这些人的行动,让这个词多了一层意味。他们有点不认命,开始把反对意见交到公众面前。

五、奥本海默的幻灭,能否避免?

这轮 AI 研究者的忧虑和幻灭,可以用“奥本海默时刻”来形容。我们熟悉的那句“现在我成了死神,世界的毁灭者”,是奥本海默在 1965 年的纪录片中,回忆二十年前第一次核爆时引用的。

这段回忆太有戏剧性,很容易让人把道德觉醒想象成一个瞬间:毁灭发生,创造者终于意识到自己做了什么。

但科学家的反思可以发生得更早。1945 年 7 月 17 日,西拉德与同事联名向美国总统请愿,要求限制原子弹的使用。那时,广岛还没有遭到核打击。

对今天的研究者而言,幻灭也可以发生在一次普通的公司谈话中。你还在做有趣的研究,周围的人依然友善;你开始明白,自己参与创造的力量,将按一种你无法接受的方式继续发展。

技术能力没有自动带来控制权。一个人可以知道怎样让模型更强,却决定不了公司要把它交给谁、让它进入什么领域,也决定不了外部社会应该承受多大的风险。

再往深处走,就会遇到硅谷的一种政治欲望。

我之前跟会员分享过一本新书,《The Nerd Reich:硅谷法西斯主义与民主战争》,其中追踪了技术精英用公司治理替代公共政治的野心。在作者分析的这套世界观里,选举、法律、媒体与公众监督,被视作杰出创造者摆脱不了的束缚。

这类想法早有清楚的表达。科技投资人、PayPal 联合创始人彼得·蒂尔,在 2009 年的一篇文章中就写过:“我已经不再相信自由与民主是相容的。”

问题在于,这种自由究竟属于谁。技术精英希望自由地创造、扩张和改变世界,普通人却可能失去拒绝这些改变的资格。民主程序被看成拖延,人们的反对被看成落后,少数人的远见则被赋予高于公共讨论的地位。

当救世使命、持续的敌我动员与精英自我授权合在一起,就带上了法西斯式政治的影子。组织对成员要求奉献,也要求外部世界接受它所定义的未来。

这时候,一家公司对社会说自己心怀善意,已经远远不够。好人也可以组成一个无法接受外部约束的权力中心,越真诚,越确信自己必须赢。

技术公司正在尝试教 AI 尊重人的意愿。人类也需要先问这些公司,是否尊重人的拒绝。

创造的能力,可以成为专业权威的来源,但它不能自动成为统治他人的许可证。

这些离职者的故事,至少让那张许可证不再显得理所当然。

Kokotajlo 谈到,他有两个孩子。有时,他和妻子会计划,过几年,小的和大的就能去同一所学校,他们可以一起送孩子上学。然后,脑子里会冒出另一个声音:也许不会。

他甚至希望,AI 最后只是一种有经济价值的普通技术,自己的担忧在五年、十年后显得可笑。

“我会显得很傻,但我会拥有一个美好的家庭。”【懂】

经叔最近做了一个网站,可在本号首页右下角订阅。

人肉筛选挖掘的硬核优质内容及深度原创,重点关注科技、文化、财富、权力四大要素以及它们之间的互动与影响。网站定价1999元/年,目前内测优惠价1299元/年,感兴趣的读者可以加经叔微信订阅。

另外,欢迎加入经叔的知识星球。在这里,我们拒绝无用的焦虑,只谈底层的逻辑与实战的干货。我会结合最新的AI前沿动态、深度的商业创新分析(如一人企业的构建)和独特的文化思潮(如麦克卢汉的媒介洞察),帮助大家把握时间窗口。

我是不懂经的经叔,国内最早翻译介绍了纳瓦尔的《如何不靠运气获得财务自由》,以及影响了纳瓦尔、中本聪、马斯克等大佬的《主权个人》。

不懂经知识星球,众多百万粉丝大V、千万及亿万富翁订阅。专注分享一人企业、一人创投主题,关键词:AI、IP、创投、科技及商业前沿的高杠杆内容。

打开网易新闻 查看精彩图片

愈懂愈自由