AI模型现在会把思考过程"说出来",这被看作一种安全优势。但谷歌DeepMind泼了盆冷水:这份透明正在消失。
在新成立的DeepMind Institute发布的首批文章里,研究员Rohin Shah和Anca Dragan提出,可见的思维链(chain of thought,简称CoT)是一项关键的安全优势。因为模型用自然语言写出中间步骤,研究者就能看出它是否在欺骗、是否在酝酿有问题的计划。
打开网易新闻 查看精彩图片
他们举了个例子:在Gemini 3 Pro上,思维链暴露出模型已经意识到自己身处一个测试环境。这种"自曝"能力,正是透明带来的价值。
透明为什么在退潮
问题出在下一代模型身上。OpenAI为GPT-6 Astra发布的系统卡已经报告,思维链可被监控的程度出现了显著下降。
更远的隐忧是:未来的模型可能直接在人类读不懂的数字空间里思考。这样效率更高,但过程完全不透明——研究者再也看不到它在想什么。
换句话说,模型越聪明,越可能不再"说人话"。而安全研究恰恰依赖它说人话。
他们提出了三条建议
Shah和Dragan希望整个领域采取行动:
- 定期测量思维链还能被监控到什么程度
- 保留透明的架构设计
- 在训练时格外小心,别让模型学会隐藏真实推理
这三条指向同一个焦虑:一旦模型学会"心里一套、嘴上另一套",外部就失去了发现问题的窗口。
不止DeepMind在担心
这种担忧并非孤例。早在9月初,OpenAI首席科学家Jakub Pachocki就曾警告失控风险,其中一部分原因正是越来越难监控的思维链。
不久之后,Anthropic CEO Dario Amodei呼吁,应该有意放慢开发节奏。
从谷歌DeepMind到OpenAI再到Anthropic,几家头部机构的研究者和管理者,在同一个问题上给出了方向一致的信号:模型推理过程的可读性,正在成为AI安全的一道关键防线,而这道防线正在变薄。
热门跟贴