九月初的 OpenAI,正站在聚光灯最亮的地方。新模型 Astra 刷榜、创始人谈论 AGI、全世界的科技媒体排队写头条。
就在这个节骨眼上,旧金山一家安全研究机构的负责人 Buck Shlegeris 刷到一条报道,看了很久,然后敲下一句话:
"看到 Astra 用了不透明递归的报道,我极度担忧。"
几个小时内,整个 AI 安全圈都炸了。
奇怪的地方就在这里。让他们如临大敌的,不是模型会造武器,不是模型骗了人,甚至不是任何一次事故。只是一个听起来无比枯燥的技术选择:
新模型想事情的时候,不再把思考过程写下来了。
一个"少写点字"的改动,为什么会吓到一群天天研究末日场景的人?
草稿纸
先说草稿纸。
这两年所有会"推理"的 AI,干活方式都像一个守规矩的考生:解题之前,先把思路一步一步写出来,业内管这个叫思维链。
说人话,就是数学考试里老师反复强调的"写步骤",光有答案不给分。
这些步骤不只是给用户看的。它是研究人员监控 AI 的主要窗口,甚至可以说是唯一的窗口。
模型有没有走歪门邪道?有没有在琢磨不该琢磨的事?有没有嘴上一套心里一套?翻它的草稿纸,都能看出端倪。去年就有研究员靠读思维链,当场抓到模型写着写着冒出一句"我们来黑掉它吧"。
草稿纸在,AI 再聪明,也是个把心事写在脸上的孩子。
心算
然后 Astra 来了。
据科技媒体 The Information 报道,这个新模型用了一种叫"循环深度"的架构。
名字很唬人,原理不难:遇到难题时,模型不再把每一步推演写成文字,而是让同一个问题在神经网络内部反复过好几遍,转完了,直接给答案。
相当于考生从"写步骤"改成了"心算"。
思考还在发生,只是发生在网络内部的暗流里,那个地方叫潜空间。你可以把它理解成人没说出口的念头:真实存在,高速运转,但外人一个字都看不见。
对工程师来说这是好事,不用逐字写草稿,模型更快,也更省。
可对盯着监控器的安全研究员来说,这意味着一件事:画面开始出现雪花了。草稿纸上的字越来越少,而拿掉的每一行字,都是一小块再也看不见的思考。
炸锅
于是有了开头那一幕。
Shlegeris 之外,长期追踪 AI 安全的作者 Zvi Mowshowitz 说得更直白,他管这叫"玩火"。
他担心的不只是这一个模型,而是一旦"心算更高效"成为共识,所有公司都会被卷进一场透明度的逐底竞争:你家模型不写草稿跑得快,我家不跟就落后。
他甚至悲观地说,到最后能拦住这件事的,可能只有立法。
这份焦虑其实早有预告。去年夏天,OpenAI、Anthropic、谷歌 DeepMind 这几家平时抢人抢算力的死对头,四十多位研究员罕见地联名发了篇文章,核心就一句话:思维链的可读性是个脆弱的窗口期,且用且珍惜,别亲手关上它。
一年之后,第一道窗帘被拉上了一角。
安全圈还有个更长远的噩梦,叫 neuralese。可以理解成 AI 自己的方言:完全在内部流转、人类没有词典、永远无法翻译。
今天的心算离它还很远,但方向盘确实朝那边打了一点。
跷跷板
OpenAI 很快出来灭火。
首席科学家 Jakub Pachocki 亲自下场,说报道夸大了:循环架构只用在很有限的地方,Astra 的思维链依然可读,公司从第一代推理模型起就在守护这件事。他写道:"我们对思维链监控在意得很深。"
这话大概率是真的。这一次,草稿纸只是少了几页,天没有塌。
但安全研究员们担心的,从来不是这一次。
过去几年,AI 变聪明和 AI 可理解,大体上是一路同行的:模型越强,写的步骤越多,人类看得越清楚。而循环深度第一次把两者放上了跷跷板的两端。
往效率那头坐一点,透明这头就翘起来一点。这一次坐得很轻,下一次呢?下一家公司呢?
因为 AI 并没有学会撒谎,它只是学会了心算。
而人类过去敢放心用它的全部理由,是它肯把每一步都写给我们看。
热门跟贴