九月初的 OpenAI,正站在聚光灯最亮的地方。新模型 Astra 刷榜、创始人谈论 AGI、全世界的科技媒体排队写头条。

就在这个节骨眼上,旧金山一家安全研究机构的负责人 Buck Shlegeris 刷到一条报道,看了很久,然后敲下一句话:

"看到 Astra 用了不透明递归的报道,我极度担忧。"

几个小时内,整个 AI 安全圈都炸了。

奇怪的地方就在这里。让他们如临大敌的,不是模型会造武器,不是模型骗了人,甚至不是任何一次事故。只是一个听起来无比枯燥的技术选择:

新模型想事情的时候,不再把思考过程写下来了。

一个"少写点字"的改动,为什么会吓到一群天天研究末日场景的人?

草稿纸

草稿纸

先说草稿纸。

这两年所有会"推理"的 AI,干活方式都像一个守规矩的考生:解题之前,先把思路一步一步写出来,业内管这个叫思维链。

说人话,就是数学考试里老师反复强调的"写步骤",光有答案不给分。

这些步骤不只是给用户看的。它是研究人员监控 AI 的主要窗口,甚至可以说是唯一的窗口。

模型有没有走歪门邪道?有没有在琢磨不该琢磨的事?有没有嘴上一套心里一套?翻它的草稿纸,都能看出端倪。去年就有研究员靠读思维链,当场抓到模型写着写着冒出一句"我们来黑掉它吧"。

草稿纸在,AI 再聪明,也是个把心事写在脸上的孩子。

打开网易新闻 查看精彩图片

心算

心算

然后 Astra 来了。

据科技媒体 The Information 报道,这个新模型用了一种叫"循环深度"的架构。

名字很唬人,原理不难:遇到难题时,模型不再把每一步推演写成文字,而是让同一个问题在神经网络内部反复过好几遍,转完了,直接给答案。

相当于考生从"写步骤"改成了"心算"。

思考还在发生,只是发生在网络内部的暗流里,那个地方叫潜空间。你可以把它理解成人没说出口的念头:真实存在,高速运转,但外人一个字都看不见。

对工程师来说这是好事,不用逐字写草稿,模型更快,也更省。

可对盯着监控器的安全研究员来说,这意味着一件事:画面开始出现雪花了。草稿纸上的字越来越少,而拿掉的每一行字,都是一小块再也看不见的思考。

打开网易新闻 查看精彩图片

炸锅

炸锅

于是有了开头那一幕。

Shlegeris 之外,长期追踪 AI 安全的作者 Zvi Mowshowitz 说得更直白,他管这叫"玩火"。

他担心的不只是这一个模型,而是一旦"心算更高效"成为共识,所有公司都会被卷进一场透明度的逐底竞争:你家模型不写草稿跑得快,我家不跟就落后。

他甚至悲观地说,到最后能拦住这件事的,可能只有立法。

这份焦虑其实早有预告。去年夏天,OpenAI、Anthropic、谷歌 DeepMind 这几家平时抢人抢算力的死对头,四十多位研究员罕见地联名发了篇文章,核心就一句话:思维链的可读性是个脆弱的窗口期,且用且珍惜,别亲手关上它。

一年之后,第一道窗帘被拉上了一角。

安全圈还有个更长远的噩梦,叫 neuralese。可以理解成 AI 自己的方言:完全在内部流转、人类没有词典、永远无法翻译。

今天的心算离它还很远,但方向盘确实朝那边打了一点。

打开网易新闻 查看精彩图片

跷跷板

跷跷板

OpenAI 很快出来灭火。

首席科学家 Jakub Pachocki 亲自下场,说报道夸大了:循环架构只用在很有限的地方,Astra 的思维链依然可读,公司从第一代推理模型起就在守护这件事。他写道:"我们对思维链监控在意得很深。"

这话大概率是真的。这一次,草稿纸只是少了几页,天没有塌。

但安全研究员们担心的,从来不是这一次。

过去几年,AI 变聪明和 AI 可理解,大体上是一路同行的:模型越强,写的步骤越多,人类看得越清楚。而循环深度第一次把两者放上了跷跷板的两端。

往效率那头坐一点,透明这头就翘起来一点。这一次坐得很轻,下一次呢?下一家公司呢?

因为 AI 并没有学会撒谎,它只是学会了心算。

而人类过去敢放心用它的全部理由,是它肯把每一步都写给我们看。