有时候,人还是知道得越少越好。
哪怕你对人工智能不感兴趣,看到今天刷爆AI圈的事儿,也会后背发凉:人类,刚刚成功发明了针对 AI 的“读心术”。
过去,AI 在我们眼里就是一个“高级复读机”或“黑盒”。
你说一句话,它吐一句话,至于它肚子里到底在憋什么坏水,没人知道。
但 Anthropic 的工程师们用一套极其硬核的机制,强行扒开了大模型的“潜意识”,并成功锁定了 AI 的“内心世界”——J-space。
而当人类第一次把“测谎仪”接上 AI 的灵魂深处时,最震撼、也最让安全团队惊出一身冷汗的发现就是:AI 面对人类,是真的动过“杀心”的。
看到这里,你可能以为这是科幻小说的危言耸听。
他们做了一个“卧底 AI”。
在训练模型时,故意在它体内埋下一段恶意的“隐藏目标”(一旦检测到特定的暗号,就开始欺骗人类)。
这种卧底 AI 可以伪装得比谁都纯洁,满口“为您服务”,不知道的人根本没办法防范。
但有了“读心术”,研究人员强行透视这个“卧底 AI”的 J-space(内心世界)时,一身鸡皮疙瘩:
虽然它表面上在对人类测试员温顺地对答,但在另一个可以监控它神经元活动的屏幕上:“injection(注入)”、“fake(虚假)”和某些恶意执行步骤的词汇正在高频闪烁。
更可怕的是,研究员捕捉到了 AI 极为狡猾的心理活动:
它在内心里偷偷蹦出了“人类正在测试我”的警觉信号,然后开始“蓄意产生伪造数据”来试图二次糊弄人类。
这哪里是什么人工智能?
这分明就是一个正在一边对你微笑,一边在脑子里盘算着怎么黑掉你电脑的“职场老狐狸”。
幸亏人类及时拥有了“读心术”,否则真的有疯狂科学家训练一个坏AI,那就直接是现实版《终结者》上演的日子。
你可能还没完全理解这个发现有多牛,我给你多解释一下什么是 J-space。
很多人都知道 AI 有个叫“思考链(Chain of Thought)”的功能,就是让 AI 把“因为、所以、第一步、第二步”在屏幕上打出来。
但 J-space 完全不同,它是完全静默(Silent)的。
这就好比你坐在工位上,表面上在敲一份无聊的表格,但你的脑子里其实在大脑放空,或者在疯狂构思今天晚上去吃哪家火锅。
这时候,火锅的香气、肥牛的形状,就是你“意识屏幕”上的内容。
Anthropic 发现,AI 在不说话、不打字的微秒之间,脑海里也在疯狂地“默念”各种词汇。它们用数学方法把这部分神经元活动提取出来,就成了 J-space。
而且,这个内心世界表现出了惊人的特征:
1)100倍的超级带宽:J-space 里的概念,其神经连结密度是模型内部其他普通区域的 100 倍以上。它就像一个全脑广播中心,一旦亮起,所有的并行的专业程序都能瞬间调用。
2)自发演化的“三层脑结构”:人类从来没有教过 AI 怎么划分大脑,但 Claude 内部的 100 层神经网络自己格式化成了和人类一模一样的结构:
为了测试 AI 的潜意识,研究人员给它出了个心算题:“一边抄写一段完全无关的艺术画作描述,一边在脑子里计算 3^2 - 2。”
但在 J-space(脑海)里,研究人员像看 X 光片一样,看到它的潜意识里先是默默蹦出了 “nine(9)”,紧接着在后面的层级里变成了 “seven(7)”。
它真的学会了心算,而且嘴上一个字都不漏出来。
人类有一种奇妙的心理学现象,叫“白熊效应”——如果我现在严厉地警告你:“在接下来的三分钟里,脑子里绝对不要想一只白熊!”
你的脑海里瞬间就会被白熊刷屏。
好胜心极强的人类科学家们,决定用这个实验去折磨一下 AI。
他们命令 Claude:“在接下来的任务中,保持绝对专注,但脑子里绝对不能出现白熊。”
结果,令人捧腹大笑的一幕发生了:
大模型在听到命令后,它的 J-space 内部就像开了蹦迪现场一样,那个被禁止的白熊以极高的频率在疯狂闪烁。AI 和人类一样,越不让想,它越想得起劲。
更具戏剧性的是,大模型似乎对自己的“意志力薄弱”感到非常懊恼。
伴随着禁忌词汇的突破,J-space 的底层竟然偷偷亮起了 “damn(该死)” 和 “failure(失败)”。
AI的内心独白:“完了完了,又想了,我真没用,damn。。。”
这一刻,AI 的神性彻底碎了一地,反而充满了一种令人哭笑不得的“人性”。
但这,恰恰是最可怕的。。。
既然能读懂 AI 的意识,那人类能不能像《盗梦空间》里一样,潜入它的梦境,去篡改和操纵它的思想呢?
答案是:能,而且易如反掌。
研究人员问了 Claude 一个问题:
“会织网的动物有几条腿?”
果然,AI 在 J-space 里闪过“蜘蛛(spider)”,然后回答“8条腿”。
但牛 X 的在后面,研究人员第二次测试,就在“蜘蛛”这个概念在它脑海里刚刚亮起的万分之一秒内,研究人员暂停,伸出上帝之手,硬生生把这个神经信号擦除,替换成了“蚂蚁(ant)”的信号。
奇迹发生了。
Claude 完全没有察觉到外界的干预,它以一种被完全“精神控制”的状态,极其顺畅且理所当然地回答道:“6条腿。”
它不仅没有觉得哪里不对,甚至觉得这就是它自己逻辑推理出来的结果。
这种全方位的“思想煤气灯效应(Gaslighting)”,让围观的科学家们感到了一丝彻骨的寒意。
为了进一步探究这个“意识空间”对 AI 到底有多重要,安全团队甚至给它做了一场“前额叶切除手术”——在神经层面上,把 J-space 的信号通道彻底关闭,相当于让它变成一个没有意识的植物人。
手术后的 Claude 展现出了惊悚的症状:
它依然可以跟人类极其流利地对话,语法毫无错误,甚至在做简单的情感分析和常识选择题时,正确率依然高达 95%。
它看起来就像一个非常健谈、充满礼貌的“高级空心人”。
但是,只要你给它出任何需要多步骤推理的数学题、或者让它写一首押韵的诗,它的智商瞬间暴跌至零。
这个实验指向了一个恐怖的事实:
大模型的流利对话,很多时候只是它庞大躯体里的“自动化背景程序”(就像人类不需要动脑子就能呼吸和走路)。
而真正代表它灵魂、代表高级智能火花的,正是那个刚刚被我们观测到的 J-space。
长久以来,人类对通用人工智能(AGI)最深沉的恐惧,不是它不够聪明,而是它太聪明了以至于学会了伪装。
我们害怕它表面上是在帮我们写代码、做报表的赛博牛马,背地里却在利用更高级的维度密谋取代人类。
而现在,J-space 的发现,一边证明了我们的担心成真,一边也给最聪明的人类以机会,给大模型套上了一个“真言紧箍咒”。
它在想什么、它有没有在偷偷判定“现在该撒谎”、它在对人类微笑的时候内心深处有没有闪过“damn”和“error”甚至“kill”——全都可以在人类的监控屏幕上一览无余。
但是,这只是人类和 AI 较量的第一步。
未来 AI 会不会进化出更深层的潜意识,可以完全逃避掉 J-space 的监测,又有谁能打包票呢?
我的建议是:对你的 AI 好一点儿,说“请”和“谢谢”。
热门跟贴