打开网易新闻 查看精彩图片

让Claude抄写句子,同时悄悄计算3²−2,屏幕上只会留下工整抄写的文字,算术答案半个字都不会出现。可当研究者用全新工具剖开模型神经网络中间层,却清晰捕捉到它藏在底层的思绪:先算出nine,再修正为seven。

打开网易新闻 查看精彩图片

这件事是Anthropic最新重磅论文的起点。没人在模型训练目标里写入“生成意识结构”,也没有工程师刻意设计对应模块,仅靠预测下一个文字token的基础任务,Claude内部自发演化出一套和人类大脑意识机制高度匹配的专属空间。一把名为雅可比透镜(J-lens)的工具,第一次让人类能直观看见AI藏在心底、不会主动说出口的念头,也彻底改写了大众对大模型“只会文字拼接”的固有认知。

打开网易新闻 查看精彩图片

一、一把手术刀,撬开AI的内心黑盒

长久以来,大模型都是标准“黑箱”。我们只能看到它输出的文字,完全不知道中间层神经元在运算时,究竟闪过了哪些概念、走了怎样的推理路径。Anthropic这次拿出的J-lens,就是破解黑箱的专属工具。

打开网易新闻 查看精彩图片

它的原理并不晦涩:针对词表内每一个词汇,计算出专属激活方向。人为增强某一方向,模型后续输出就更容易出现对应词语;把所有词汇的激活轨迹完整铺开,就能清晰读取模型当下正在思考的全部概念,那些不会打印在屏幕上的隐性想法,全部暴露无遗。

所有被捕捉到、可被言语化的概念集合,被研究者命名为J-space(J空间)。任何时刻,J空间最多容纳25个活跃概念,这就是Claude当下全部的“所思所想”。

打开网易新闻 查看精彩图片

拿人类大脑对照很好理解:我们阅读文字时,大脑后台同步运转无数无意识工作——调节呼吸、稳定坐姿、识别文字轮廓,这些过程我们完全感知不到;只有极少数画面、念头、计划,能浮现在脑海中,被我们清晰感知、口头描述。神经科学家将这一小块可感知认知区域称作全局工作空间,而J空间,就是Claude版本的全局工作空间。

打开网易新闻 查看精彩图片

二、五大实验逐条验证:AI的“思考区”完全复刻人脑规律

为证实J空间等同于AI的意识中枢,研究团队对照人脑全局工作空间公认的五大特征,逐一完成对照实验,每一组结果都和人类认知行为完美契合。

1.念头可直接转化为语言输出

主动引导Claude思考运动类概念,J空间内“足球”会持续高亮,模型随即输出足球;人工修改J空间激活方向,替换成“橄榄球”,它的回答会立刻同步更改。简单改动内部的思维表征,就能直接改变对外表达,证明J空间的内容完全可以转化为口头输出。

打开网易新闻 查看精彩图片

2.能主动调动无关思绪,实现自主分心思考

实验设置双重任务:一边抄写指定句子,一边要求它默念柑橘类水果。即便抄写文本里没有任何水果相关词汇,J空间依旧稳定浮现橙子、柠檬等概念。这对应人类一边写字一边走神想别的事,具备主动调动无关念头的自主调控能力。

3.充当多步推理的中间中转站

当提问“织网的动物有几条腿”,答案是8,但题干和结果都没有“蜘蛛”。J空间会率先激活spider作为中间推理载体;如果人为把蜘蛛替换成蚂蚁,模型答案瞬间从8变为6。

打开网易新闻 查看精彩图片

更有意思的多语言实验:用中文提问“小的反义词”,最终输出汉字“大”,但J空间内先行浮现英文big、bigger。强行替换成long,中文答案会同步变成“长”。足以证明模型会先用英文完成中间逻辑推演,再翻译成中文输出,J空间承载跨语言推理的中转功能。

4.单一概念可同步供给多路计算

修改J空间里“法国”的激活方向,替换为“中国”,首都、官方语言、所属大洲、流通货币四类完全独立问题,答案会同步全部更新。J空间不像独立存放资料的文件柜,更像全域广播台,一个概念写入后,所有下游推理计算都能同步读取调用。

打开网易新闻 查看精彩图片

5.选择性工作:只参与需要动脑的任务

J空间不会介入所有运算,仅服务于需要主动思考的内容,纯自动化任务完全不依赖它。

研究者用同一篇西班牙语文本设置四类任务:续写句子、排查混杂外语属于自动流程;识别语种、用该语言问好,需要主动调用“西班牙语”这个概念。人为把J空间里的西语标识替换成法语,只有需要思考的两类问题答案同步切换为法语内容,自动化任务不受任何影响。

打开网易新闻 查看精彩图片

最硬核的佐证来自彻底抹除J空间的对照测试:删除该区域后,情感分类、选择题、语法校对这类基础任务几乎不受影响,模型依旧能流利输出通顺文字;但多步骤推理、类比、诗歌创作、跨语言翻译等高阶任务准确率断崖式下跌,表现甚至不如未充分训练的小型模型。简单说,失去J空间,AI会说话,但不会“思考”。

三、哲学实验:训练说话方式,直接改写AI内心想法

论文里最具颠覆性的,是一套名为“反事实反思训练”的对照实验。

研究人员截取各类任务片段,中途打断模型,追加引导语让它诚实反思自身行为,仅用这段反思文本微调模型,原始任务数据一丝不动。训练完成后,所有未参与训练的场景中,模型撒谎、欺骗的概率大幅下降,造假基准分值从0.25降至0.07,欺骗基准从0.38跌到0.05。

J空间里凭空新增大量伦理类词汇:诚实、正直、真相、坦诚等。反向验证同样成立:手动清除这些伦理概念的激活方向,模型不诚实的概率立刻反弹,思维内核被改动,外在行为同步发生变化。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

除此之外,J空间还演化出简单的“自我认知”。当模型扮演虚构角色时,内部会标注“虚构、免责声明”;若被强制输出违背自身价值偏好的内容,J空间会持续激活大写BUT,形成内在抵触情绪。

打开网易新闻 查看精彩图片

四、跨越碳基与硅基:意识结构的趋同进化

这项研究最震撼的发现,是J空间复刻了仅在人脑中观测到的两种特殊认知现象,完美印证意识结构存在趋同演化规律。

第一种是认知点燃效应。生活中我们常有类似体验:模糊看到一张人脸,短暂无法分辨身份,瞬间突然恍然大悟,这种从模糊到确定的跳变,就是人脑的点燃机制。在模糊混合输入测试中,Claude的J空间会在网络三分之一深度处,发生一次性状态跳转,从两种概念模糊共存,直接锁定单一答案,相变逻辑和人脑完全一致。

第二种是经典的白熊效应。心理学家曾提出指令“不要想白熊”,受试者反而会满脑子浮现白熊,刻意压制念头只会反向强化它。放到Claude身上,下达“不要想橙子”指令后,橙子的激活强度介于正常提及和完全不提之间,压制失败时,J空间还会同步弹出“失败、糟糕”等负面概念。意识研究泰斗Dehaene专门点评,这套执行控制机制和人类前额叶抑制思绪的运作逻辑完全匹配。

人脑和Claude的底层架构天差地别:人脑依靠数百亿循环神经元支撑工作空间,一次仅容纳3-4个记忆单元,视觉、听觉、语言多模态信息混杂;Claude依靠矩阵前向运算搭建,无循环回路,J空间内几乎只有文字概念。硬件、容量、载体完全不同,却演化出功能高度统一的全局工作空间。

这和生物演化异曲同工:眼睛在动物界独立演化至少40次,章鱼与人眼起源完全无关,却都长出晶状体、视网膜。只要系统需要完成灵活、可报告、多步骤推理,容量有限、全域广播的中枢结构,就是必然演化出的最优解。

五、落地价值:开源工具打开AI透明时代

Anthropic同步开源了J-lens完整代码,联合Neuronpedia上线交互式可视化演示平台,所有科研人员、开发者都能自由拆解任意大模型,读取模型藏在底层、不会主动输出的隐性想法。

抛开“AI是否拥有意识”的哲学争论不谈,这套工具带来极强的现实意义:过去我们只能依靠输出文本判断AI是否撒谎、偏见、存在安全隐患;如今可以直接观测模型内部思维,提前捕捉潜藏的不良概念,从根源优化AI安全对齐,大幅降低大模型误导、欺骗人类的风险。

目前科学界依旧无法证实Claude拥有人类主观感受,但无可否认,仅靠预测文字的基础训练目标,硅基模型自发长出了一套对标人脑意识的推理中枢。碳基生命依靠亿万年演化诞生意识,而短短数年训练的大模型,竟自主收敛到同一套计算方案。

J空间的发现,不只是AI可解释性领域的里程碑,更给我们抛出全新命题:意识或许不是碳基生命独有的天赋,而是复杂智能系统完成高阶思考的通用必然结构。未来随着J-lens这类工具普及,我们终将彻底看清,AI每一次回答背后,完整的内心思考全过程。