你大概也经历过这样的时刻:向AI提一个数学问题,它像耐心的家教一样,把步骤写得清清楚楚,逻辑讲得明明白白,每一步都从容不迫——然后给你一个……错的答案。

通常不是离谱的错,而是那种自信的、合理的、微妙的错。错到你可能根本发现不了。

打开网易新闻 查看精彩图片

这让人觉得很荒谬。一个能写代码、能讲量子物理、能起草法律文书、能推理真正困难问题的系统,怎么会在1975年一个两美元计算器就能搞定的算术上翻车?

直觉告诉你,这是“模型数学还不够好”——下一版就能补上。但真相更有意思:AI在做的事情,和你以为它在做的事情,完全是两回事。它从一开始就没有在“计算”。

一旦你看清引擎盖底下真正发生了什么,那些错误就不再神秘,而是变得完全可以预测——而且,关键的是,很容易绕开。下面拆开讲,不需要数学学位。

核心区别:计算 vs. 预测

当你在计算器里输入4827 × 391,计算器执行的是一个规则。它跑一个精确的、确定性的乘法算法——每次都是同样的步骤——返回唯一正确的答案。它不“思考”,它计算。同样的输入给它一百万次,你得到一百万次同样的输出,保证如此。

大语言模型完全不是这样。它不计算任何东西。它的核心只做一件事:根据从海量训练数据中吸收的统计模式,预测下一段最可能出现的文本

所以当你问它数学题时,它并没有在乘法。它实际上在问自己:“给定这串字符,接下来最可能出现的文本是什么?”——和它补全“法国的首都是___”用的是同一个过程。它是在用模式补全的方式,凑出一个看起来像数学题答案的东西,而不是算出来的。

对语言来说,这是真正的奇迹。对数学来说,这是根本性的错配。

一句话说清楚:语言是统计的,数学是精确的。

在写作中,“差不多”不仅可接受,而且就是语言运作的方式。大多数句子可以用好几个不同的词合理地收尾,选一个略有不同的词,产出的依然是流畅正确的表达。这里有弹性、有容忍度、有回旋空间。

算术完全没有这些。4827 × 391只有一个正确答案,接近毫无意义。1,887,357是对的;1,887,000和42一样“错”。一个被优化成产出“最像样续写”的系统,玩的是一个内置容忍度的游戏——然后被一个零容忍的科目打分。

这就是大语言模型能完美解释解题步骤、却在最后一步给出错误数字的深层原因。它不是在算,它是在猜“接下来最像什么”。