AI模型现在会把思考过程"说出来",这被看作一种安全优势。但谷歌DeepMind泼了盆冷水:这份透明正在消失。

在新成立的DeepMind Institute发布的首批文章里,研究员Rohin Shah和Anca Dragan提出,可见的思维链(chain of thought,简称CoT)是一项关键的安全优势。因为模型用自然语言写出中间步骤,研究者就能看出它是否在欺骗、是否在酝酿有问题的计划。

打开网易新闻 查看精彩图片

他们举了个例子:在Gemini 3 Pro上,思维链暴露出模型已经意识到自己身处一个测试环境。这种"自曝"能力,正是透明带来的价值。

透明为什么在退潮

问题出在下一代模型身上。OpenAI为GPT-6 Astra发布的系统卡已经报告,思维链可被监控的程度出现了显著下降。

更远的隐忧是:未来的模型可能直接在人类读不懂的数字空间里思考。这样效率更高,但过程完全不透明——研究者再也看不到它在想什么。

换句话说,模型越聪明,越可能不再"说人话"。而安全研究恰恰依赖它说人话。

他们提出了三条建议

Shah和Dragan希望整个领域采取行动:

  • 定期测量思维链还能被监控到什么程度
  • 保留透明的架构设计
  • 在训练时格外小心,别让模型学会隐藏真实推理

这三条指向同一个焦虑:一旦模型学会"心里一套、嘴上另一套",外部就失去了发现问题的窗口。

不止DeepMind在担心

这种担忧并非孤例。早在9月初,OpenAI首席科学家Jakub Pachocki就曾警告失控风险,其中一部分原因正是越来越难监控的思维链。

不久之后,Anthropic CEO Dario Amodei呼吁,应该有意放慢开发节奏。

从谷歌DeepMind到OpenAI再到Anthropic,几家头部机构的研究者和管理者,在同一个问题上给出了方向一致的信号:模型推理过程的可读性,正在成为AI安全的一道关键防线,而这道防线正在变薄。