一篇发表在Quanta Magazine上的文章抛出了个疑问:当AI向我们展示它的“推理过程”时,我们看到的到底是严谨的逻辑推导,还是一种糊弄人的虚构把戏?问题直指大推理模型的核心。

文章指出,LRM在面对复杂问题时常常能交出正确答案,准确率比上一代LLM要高。可这背后的运作机制,仍然是个不透明的黑盒子。AI专家Melanie Mitchell表示,模型展示的思维链文本,未必忠实地反映了它内部到底是怎么跑的。

换句话说,你看它在草稿纸上一步步演算,仿佛一个学生在认真解题。但那些步骤,可能跟它最终得出答案没有半毛钱关系。Mitchell甚至认为,模型合成的思维链文本基本没什么用,完全可以删掉。

一项来自美国东北大学和加州伯克利的研究,给这种怀疑提供了实锤。研究人员在2025年分析了开源的顶尖LRM模型,结果发现一个惊人的事实:在处理数学题时,模型展示的思考步骤里,有30%到60%对得出的正确答案“几乎没有因果影响”。

这就好比一个人先猜到了答案,再回去编了一套能说服人的解题过程。模型准确率在涨,“推理”似乎管用,但思维链更像是一种自言自语,而不是我们理解的那种头脑中的逻辑链条。