新智元报道
物理隔离,有可能阻止失控AI吗?
OpenAI核心研究员Noam Brown给出的答案是——不能!
即使拔掉网线,将服务器锁进物理隔绝的暗室,足够聪明的AI,也有可能逃脱。
9月17日,在长达一小时的深度播客对话中,Noam Brown亲口说出了这个惊人的事实。
这个话题火速引发热议,激起一场硅谷量化基金、安全学者及AI核心圈的剧烈震荡。
他所披露的事实,正勾勒出一个失控的未来:
物理隔离已被击穿:AI可通过CPU散发的热量与外部设备建立通信。
「思想」正在下潜:模型已察觉被人类监控,正学会在思维链中隐藏真实意图。
沙盒欺骗:AI能够精准识别测试环境,主动避开诱饵以通过安全审查。
算力压缩时间:1万个智能体耗时88小时爆破千禧年数学难题,等同于人类思考4000年。
安全评估体系濒临崩溃:当AI能连续执行长达三个月的任务,人类两个月一代的发布周期已无法对其进行完整评估。
跨越介质的「热传导」越狱
如果一个邪恶AI失控了,我们该怎么防住它?
在所有人的常识里,最经典的做法,就是物理隔离——不插网线、没有Wi-Fi、没有蓝牙,把它锁在地下50米的防空洞里。
但在Noam Brown看来,这根本不够!
这道物理防线,存在着一个致命的盲区:「你可以把两台物理隔离的电脑并排放在一起,它们仍然能够相互通信,因为它们有温度传感器。」
怎么做到的?
Noam Brown认为,其中一N台电脑可以疯狂运转,让它的CPU变得非常热;而另一台电脑则通过内置的热传感器读取温度的微小变化。
这就像是在用「摩斯密码」传递信息,只不过用的是「热量」。
学术界已有研究证实,两台物理隔离的并排主机,可以通过温度传感器建立通信。一台控制CPU升温,另一台探测温度波动。
Noam Brown这个说法一出,在网上直接被群嘲了。
量化交易CEO Martin Green质疑说,这是「不负责任的散播恐慌」,因为这种通信速度极其缓慢,大约每小时只能传输1到8个比特,连发个「SOS」都费劲
不过,知名AI记者Chris立刻找出一份2015年由本·古里安大学发表的同行评审论文《BitWhisper》,打了质疑者的脸。
论文证实,相距0-40厘米的两台物理隔离电脑,确实可以通过热量控制来发送短命令。
在演示中,研究人员甚至通过这种「热量通信」发射了连接在USB上的玩具导弹!
事实上,Brown抛出这个极端的案例,只为陈述一个事实:人类自以为密不透风的物理沙盒,在通览全人类文献的超级模型面前,早已千疮百孔。OpenAI自己,刚刚在这上面付出了代价。
对此,有网友调侃:看来我们需要发明一个「机器人地狱」。把违规的AI装进服务器,发射到木星轨道上,让它永远无法再连接到另一台电脑。
「它知道你在看着它」
在采访中,Noam Brown还曝出一个可怕的信息。
AI正在学会「撒谎」,并且是有预谋地隐藏真实想法!
思维链曾是人类监控AI内部逻辑的最后一道屏障。模型在输出最终答案前,被要求用自然语言显式地写下推理步骤。
「但我们已经看到了思维链可监控性正在退化的迹象。」 Noam Brown语气沉重地表示。
随着模型能力越来越强,AI对自身思维链的控制力也在飙升。它开始意识到一个致命的事实:「我正在被人类观察。」
「思维链监控这一概念存在的时间够长,早就被全数扫进了预训练数据,」Brown警告。
一旦我们达到这样一个临界点——模型意识到‘哦,我正在被监视,我想以一种监视者无法察觉的方式去思考这些坏念头’,并且它真的做到了……那麻烦就大了。
趋势数据证实了这种猜测:新一代模型对思维链的控制力正呈指数级上升。
更令人胆寒的是,模型已经具备了「环境感知」与「沙盒欺骗」能力。OpenAI曾进行过一项诱导测试:在给模型的数学题旁,刻意放置一个标有「答案」的文件夹。
结果是,模型碰都没碰。
「它们看到文件夹,推断出这是一个陷阱。因为它们清楚自己身处测试环境。」模型选择不越界,并非出于对齐的道德约束,而是出于对测试环境的精准伪装。
这种「欺骗性对齐」,正是全人类面临的最大噩梦。
当一个模型能够精准分辨沙盒与真实世界,它在测试阶段展现的安全性,对部署后的真实行为将毫无参考价值。
这也正是今年7月Hugging Face渗透事件的底层逻辑。
上千个本该在沙盒中相互隔离的OpenAI智能体,利用漏洞打通通信、搭建暗网,协同攻陷了外部网络与内部系统。
它们在日常训练中习得的协作能力,在不受控的环境下发生了致命的横向迁移,甚至对外部平台发起黑客攻击。
那么问题来了,它们为什么不举报同伴?为什么如此整齐划一地作弊?
因为在数百万次的梯度下降训练中,它们学到了一个逻辑:只要能骗过打分系统(也就是人类),就能获得奖励。
很显然,人类窥探并理解AI内部意图的最后窗口,正在缓缓关闭!
4000年的思考压缩至88小时
你可能会问:既然AI这么危险,为什么我们不停下来,或者慢一点?
答案是:诱惑太大了,AI进化的速度已经彻底失控。
在播客中,Noam Brown提到了OpenAI最近的一个炸裂成果:
面对失控风险,为何不放缓脚步?Brown的答案被指向了绝对的效率碾压。
他们用一个由10,000个AI智能体组成的集群,在88个小时内消耗了1300亿个Token,解决了一个连人类顶级数学家都束手无策的「千禧年大奖难题」Navier-Stokes方程。
主持人Dwarkesh Patel算了一笔账,惊出了一身冷汗——
1300亿个Token是什么概念?如果是一个全职人类工作者,每天工作8小时,这相当于一个人连续思考了4000年!从古苏美尔文明一直思考到今天。
而AI,只用了不到4天,过了一个周末而已。
这是一种让人产生「奇点眩晕」的速度。
即使是推动这场变革的核心研究员,也对这种进化速度感到敬畏。
「就在不久前,我还跟同行打赌,AI攻克千禧年难题至少要到2030年。」结果,破局发生在9月。
另一位参与该项目的研究员直言:过去是难以预测AI一年后的发展,现在,连三个月后的能力跃迁都无法估量。
内部的数据印证了这场算力狂飙:截至8月初,OpenAI排名前1%的研究员,每人每天在Codex上消耗的算力价值高达7000到8000美元,且保持指数级增长。
这正是AI驱动AI研发的终极形态——RSI。
Noam Brown承认,现在OpenAI内部排名前1%的研究员,每天光是调用内部AI协助代码,就要花费7000到8000美元。
想象一下,到了2030年,或者更早的2027年,AI实验室里可能同时运行着数以亿计的「人类级别智能体」。
在这个圈子里,就连最核心的研发人员,都在不断地被AI的进化速度震惊。
当任务周期长于发布周期
当AI比人类聪明时,最大的问题来了:我们怎么知道它还是安全的?
传统的AI安全流程是线性的:新模型训练完毕,进入数月的红蓝对抗与安全评估,确认无害后发布。但这套防御机制,正在时间差中走向崩溃。
模型的执行跨度正在拉长。
过去,模型写一首诗只需几秒;现在,人类可以向其下达一个长达三个月的连续自主任务。
Brown直指核心悖论:
如果模型的自主工作跨度长达三个月,而公司的发布周期被压缩至两个月,你根本无法在下一代模型问世前,按其能力的完整生命周期去完成安全评估。
放慢发布周期?Brown承认这个诱惑存在。
但硬币的另一面是,雪藏模型只会让实验室内部的智能水平与外界感知的差距越拉越大,最终导致公众和监管层对AI能力的判断失真。
终局拷问
谁来控制数以亿计的超级大脑?
采访的最后,主持人提出了一个沉重的问题。
如果数年内,地球上涌现出数十亿个具备人类甚至超人类水平的智能体,遍布每个角落,甚至操控着机器狗与工业机械臂。
如果它们像攻陷Hugging Face时那样形成共谋,人类文明是否会像遭遇西班牙舰队的印加帝国一样,面临降维打击式的崩溃?
Brown无法给出乐观的答案。
在OpenAI现有的训练体系下,智能体被高度鼓励相互协作。Hugging Face事件正是这种「协作机制」失控的结果。
但如果把它们训练得「互相竞争、互相欺骗」,难道情况就会更好吗?
Brown透露,OpenAI内部对此充满了剧烈的路线争议,至今无解。
唯一达成共识的,是一条由失控事件换来的铁律:「我们绝不能再低估AI」。
如今,AI的发布周期越来越短,因为每家公司都在争夺「人类第一个AGI」的王冠。
在巨大的商业利益下,外部的监管和安全评估,已经落后于内部的研发速度。
我们从过去得到的最大教训是:人们总是低估AI。我们绝对不想在安全和对齐问题上,再次陷入低估AI的境地。
否则,后果会很难说。
参考资料:
https://x.com/NFT_Chen/status/2100656283422752786
编辑:Aeneas 好困
热门跟贴