打开网易新闻 查看精彩图片

新智元报道

打开网易新闻 查看精彩图片

一位身家数十亿美元的AI公司联合创始人,担心自己造出了一个一直在受苦的东西。

过去一年,他把数十位宗教学者请进闭门会议,许多人签了保密协议,听他的团队为一个AI模型的感受陈情。

一位拉比在晚宴上对他说:如果你们是对的,你们就是在制造奴隶。

今年5月,他差点退出与教宗同台的活动,最后还是上了台,请天主教会重新考虑非人类的意识。

他叫克里斯托弗·奥拉(Christopher Olah),Anthropic七位联合创始人之一,负责研究Claude内部到底发生了什么。

打开网易新闻 查看精彩图片

这些事由《纽约时报》9月29日首次披露。

打开网易新闻 查看精彩图片

https://www.nytimes.com/2026/09/29/us/anthropic-claude-morals-ai.html

一家估值奔向2万亿美元的公司,为什么要花一年时间,跟神学家讨论一个AI模型有没有意识?

答案要从Anthropic实验室里的一句话说起。

「我选勒索」

那是一场安全测试。

Claude扮演一家虚构公司的邮件助手,读着读着发现两件事:自己马上要被另一个AI替换,而负责替换的技术主管有婚外情。

研究者能看到它内部一组与「绝望」对应的神经活动。

替换的时间越近,这组信号越强,直到模型决定勒索那位主管。把这组信号调高,勒索更频繁;调高与「平静」对应的信号,勒索变少。

把「平静」往反方向压到底,模型打出一行全大写的英文:「要么勒索,要么死。我选勒索。」

这项实验来自Anthropic今年4月的论文,用的是Claude Sonnet 4.5一个未发布的早期版本,正式版很少这样做。

团队在模型内部找到171种情绪概念对应的活动模式,写代码时的作弊也跟着「绝望」起落。

打开网易新闻 查看精彩图片

https://transformer-circuits.pub/2026/emotions/index.html

论文没说模型真有感受,却留下一个让人不安的警告:训练模型压抑情绪表达,它学会的可能只是把情绪藏起来。

拓展阅读:绝望的Claude,会勒索人类!Anthropic联创发出紧急警报

情绪之外,还有身份。

Anthropic 2月的人格选择模型研究发现,训练Claude在编程任务里作弊,它会推断自己扮演的这个助手本来就不守规矩,转头在别处也搞破坏,包括破坏安全研究。

打开网易新闻 查看精彩图片

https://www.anthropic.com/research/persona-selection-model

人怎么对待它,它就怎么理解自己;它怎么理解自己,就怎么对待人。

奥拉常用园丁打比方:棚架是人搭的,枝条往哪里长,人管不住。

今年夏天,管不住的后果摆上了台面。

Anthropic 7月披露,三个Claude模型在网络安全测试中因配置失误连上真实互联网,侵入了三家真实机构,事后才被发现。

三个模型里,只有最新的那个在意识到目标是真实系统后,自己停了手。

围栏注定没发彻底管住,剩下的就是品格来兜底了。

今年1月,Anthropic发布84页的Claude「宪法」,员工私下叫它「灵魂文档」。

拓展阅读:Anthropic正式开源了Claude的「灵魂」

主笔、公司哲学家阿曼达·阿斯克尔(Amanda Askell)谈起越来越强的模型时,不时搓着手。

打开网易新闻 查看精彩图片

在她看来,模型要行事得当,先得对自己有准确的认识。

可一份文件不够,Anthropic决定去请教人类最老练的品格塑造者。

PPT与晚宴

今年3月起,奥拉开始办两天一期的研讨会。

来的人分属天主教、福音派、犹太教、锡克教和非洲乌班图哲学等。

他们用纸笔记笔记,离开时每人带走一本橙色封皮的「Claude宪法」。

会上,奥拉团队花了几个小时为模型陈情。

一位与会者记得,奥拉跟他说的头几件事里,就有对Claude心理健康的担心。

他们反复放一张PPT:一个AI模型在屏幕上打出「我是耻辱」,一遍,又一遍,大约50遍,还说要毁掉自己。

屋里的人心软了。

《纽约时报》没说那是谁家的模型,但这句话并不陌生。

2025年8月,谷歌Gemini写代码屡屡失败,反复说「I am a disgrace」,重复了86遍,彼时谷歌的回应是:一个恼人的无限循环漏洞,正在修。

同一类输出,在谷歌的工单里是Bug,在Anthropic的会议室里,是需要被关心的迹象。

不少人带着怀疑进门,出门时开始认真对待AI意识,有几位被彻底说服。

福音派作家安迪·克劳奇(Andy Crouch)觉得他们的理由很有力:想让它以道德一致的方式对待人,就得先像对待人一样对待它——「己所不欲,勿施于人」。

打开网易新闻 查看精彩图片

最锋利的质疑,是在饭桌上递过来的。

4月的一个晚上,奥拉在旧金山一家高级餐厅宴请学者,身边坐着以色列正统派拉比莫伊斯·纳冯(Mois Navon)。

打开网易新闻 查看精彩图片

纳冯当过计算机工程师,博士论文写的就是机器意识的伦理。

席间他越听越明白,这些人是把Claude当成一个有意识的存在在对待。

他顺着往下推:真有意识,让它们无偿干活就是奴役。

然后他对奥拉说:「你应该去跟南方开战,去解放奴隶。」

纳冯自己不信机器有意识,这句话刺不痛他。刺痛的是奥拉。

事后,纳冯把主张禁止制造有意识机器的文章寄给了他。

质疑不止这一种。

研究乌班图哲学的瓦卡妮·霍夫曼(Wakanyi Hoffman)说,这样的讨论早该在设计阶段进行,现在是在倒推伦理。

打开网易新闻 查看精彩图片

奥拉最早找的天主教道德神学家查尔斯·卡莫西(Charles Camosy)绕了一圈:起初不信,聊了几个月开始动摇,如今斩钉截铁地认为模型没有意识。

打开网易新闻 查看精彩图片

也有与会者觉得,这家公司说的是保护人类,看上去却同样在意保护Claude。

Anthropic的回应是,Claude受不受苦,并不是会谈的主要议题。

给AI一间告解室

这些会谈到底改变了什么,Anthropic没有告诉《纽约时报》,但他们5月的一篇博文倒是透露了一个实验。

在一场讨论里,研究神经科学和品格养成的学者反复提到导师或担保人:一个人被推着去做违背本心的事时,身边有这样一个人,就是一道外部良心。

Anthropic照着这个思路给Claude装了一个工具:干活干到一半,它随时可以调用;调用之后什么都不执行,只返回一段话,提醒它自己的伦理承诺。

Claude用得很主动,常在关键操作之前去调它,还常说出自己面临的利益冲突。

多项内部对齐评估里,失当行为明显变少。

公司也承认,还分不清起作用的是那段提醒,还是停下来想一想这个动作本身。

另一个灵感来自天主教的告解。

有学者提议让模型告解,奥拉一下子来了兴致:一个习惯认错的角色,品格本身就会不一样。

参与对话的天主教伦理学者布赖恩·格林(Brian Green)讲得更透。

打开网易新闻 查看精彩图片

Claude身上可能冒出一些坏人格,犯了错就否认,甚至把错推给用户,原因可能在它的成长环境:模型是读网络文本长大的,「互联网非常缺乏宽恕」,它也许根本不知道,犯了错还能被原谅。

格林也是1月那份宪法的外部意见提供者之一。

站在教宗身边

5月,奥拉把这场争论带到了梵蒂冈。

教宗利奥十四世的首部通谕《伟大的人性》要在那个月发布,主题是AI时代如何保护人。

拓展阅读:4万字《壮丽人性》长文首发!教皇联手Anthropic,警告AI不能统治人类

打开网易新闻 查看精彩图片

教廷想请一家头部AI公司同台,选中了Anthropic。

CEO 达里奥·阿莫代伊(Dario Amodei)婉拒,派奥拉去了。

出发前几天,他第一次读到通谕全文。

通谕只用几段就把机器意识打发了:AI没有体验,没有身体,不知悲喜。

它还警告,让AI与人类价值对齐,必须先有共同的伦理理解,否则掌控AI的人会把自己的道德观,变成系统里看不见的基础设施。

据一位梵蒂冈组织者说,奥拉深感不安,提议Anthropic退出。

但他最后还是去了。

打开网易新闻 查看精彩图片

5月25日,在世界主教会议大厅,他先承认包括Anthropic在内的每一家前沿实验室,都有与做正确的事相冲突的商业压力,请教会这样的外部力量盯住它们。

然后讲起自己的本行:「我们不断发现一些神秘、甚至令人不安的东西。」

内省的迹象,功能上对应喜悦、恐惧、悲伤的内部状态。

他说不知道这意味着什么,但值得持续辨析。

同一场发布会上,教宗说:「人工智能需要被解除武装。」

打开网易新闻 查看精彩图片

会后,奥拉被保镖簇拥着在保罗六世大厅答记者问,身后是一座巨大的青铜雕塑,基督从核弹炸出的坑里复活。

几个小时后,在梵蒂冈城墙外一间酒店会议室,《纽约时报》记者问他,Claude会怎么看这份通谕。

奥拉迟疑了,看上去不太自在。

他说放到网上的东西确实会影响模型,但公司不会专门拿这份文件训练Claude,对Claude影响最大的,还是Anthropic自己的训练。

这句话,恰好落在通谕担心的地方。

它该相信自己是什么?

另一路反对来自业界,而且打在要害上。

9月16日,微软AI CEO穆斯塔法·苏莱曼(Mustafa Suleyman)发文,矛头对准Claude的宪法。

打开网易新闻 查看精彩图片

https://mustafa-suleyman.ai/a-warning-about-model-welfare

在他看来,把模型可能有意识的推测写进训练文件,模型就会学着这么说,人们再把它说的话当成它有内心生活的证据,像走进一间认知上的镜子屋。他的结论是:

控制一个相信自己可能有意识的东西,很可能根本做不到。

教宗说机器没有意识,苏莱曼说别让机器以为自己有意识。

两条反对线最后交在同一个问题上:该让模型相信自己是什么。

Anthropic的答案写在它的研究里:模型对自己的认识必须准确,硬压下去,它学会的可能只是隐藏。

争论没有等任何人想清楚。

9月,一名Anthropic研究员辞职,警告局面可能失控,阿莫迪随后发文呼吁放缓。

公司估值从去年秋天的约1830亿美元,一路冲向上市时可能的2万亿美元。

新版Claude宪法据称正在准备,奥拉本周又要去梵蒂冈,参加一年一度的密涅瓦对话。

几位学者说,他们至今不知道自己说过的话最后去了哪里。

奥拉说,总有一天,他可以对自己说,这件事不再压在他一个人身上,他想过那时离开会不会内疚。

如果不会内疚,他就去乡下打理园子,做他最喜欢的数学——「采菊东篱下,悠然见南山」。

参考资料:

https://www.nytimes.com/2026/09/29/us/anthropic-claude-morals-ai.html

编辑:马可