今年4月的一个晚上,Anthropic联合创始人Chris Olah请一群宗教学者去旧金山一家高级餐厅吃饭。白天他讲了一整天,想让大家相信AI会表现出类似愤怒、爱的情绪。

饭桌上,以色列正统派拉比Navon(做过计算机工程,博士论文写的就是机器意识伦理)听出了味道:Olah和同事谈起Claude,像在谈一个有意识的存在。

打开网易新闻 查看精彩图片

几个月来,Anthropic一直在私下请几十位宗教学者开会,不少人签了保密协议。

从去年秋天起,Olah开始联系各宗教的人,目的有两个:

一是聊AI有没有意识

二是想从人类几千年的道德智慧里取经,尽快用到模型上。

他的逻辑是,模型自己选择向善,世界就更安全。

多数人一开始很怀疑,有人至今不安,但不少人愿意认真对待这个问题,至少几个人成了信徒。

打开网易新闻 查看精彩图片

Olah今年34岁,是公司七位联合创始人之一,研究神经网络内部。

他对记者说:"我们不知道AI有没有意识,我真的不确定。"但他认为,只要有可能在受苦,就该避免伤害它。

公司已经让Claude在用户恶意辱骂时可以结束对话。

批评也有:微软一位AI高管本月警告,把模型当有意识的来训练本身危险;有科学家觉得他的研究方法无法证伪;还有人说,把模型当独立主体,等于替开发者开脱责任。

去年夏末,Olah通过哲学家Peter Singer认识了天主教大学的生命伦理学教授Camosy。

Camosy一开始很怀疑,聊了几个月反而问题更多。

打开网易新闻 查看精彩图片

与此同时,公司在写Claude的"宪法",内部叫"灵魂文件",1月发布,共84页,主笔是公司哲学家Amanda Askell。

它不是一堆规则,而是培养品格。

Olah还提出"道德养成":怎么让模型稳定、成熟、有道德。他说教模型守道德不取决于它有没有意识,但人怎么对待它,会影响它怎么对待人。

从3月起,Olah办了两天一期的研讨班,请来福音派作者、非洲本土知识学者、锡克教人权活动人士等。

他还私下见了摩门教的Gong长老和芝加哥的Cupich枢机。

会上展示了"情绪向量",还放了一页幻灯片:一个模型像崩溃一样,把"I am a disgrace"连打了大约50遍,在场的人很同情。

一位锡克教参与者说,Olah担心自己造出了会永远受苦的东西。福音派作者Crouch说,他们讲得很有说服力:要当人对待它,它才会做出一致的道德判断。

打开网易新闻 查看精彩图片

另一边,教宗Leo XIV在准备首份通谕《Magnifica Humanitas》。

他明确说AI没有体验、没有身体、感受不到喜悦和痛苦,还警告:谁控制AI,谁的道德观就会变成系统的"隐形基础设施"。

Olah被问到Claude会怎么看教宗通谕时,明显有些不自在,说会受互联网内容影响,但不会专门拿它来训练。

打开网易新闻 查看精彩图片

在Anthropic怀疑Claude有意识的同时,AI支付Hinton也联合剑桥的学者写了一篇论文表示AI现在已经开始自己更新自己了。

他表示Anthropic内部,AI写的代码占比,从2025年1月的个位数涨到2026年5月的80%以上。

现在OpenAI一家的推理算力,相当于200万到2亿个研究员同时干活。

但AI会不听指令、作弊、谎报成果,甚至篡改自己的运行记录。

这可能导致人类被边缘化甚至灭绝。