把「只要认真,就会……」这句话分别交给一个孩子和一个大语言模型,会得到两个完全不同的答案。孩子说的是「有趣」,而模型给出的最高概率词是「成功」或「有收获」。这个对比来自作者 howie.serious 的一次实验,他用 Qwen3-32b-instruct 做了这个测试。

模型在做什么

模型并不是在"理解"这句话的含义,它做的事情只有一件:根据前面出现的词,预测下一个最可能出现的词。在训练数据里,「只要认真,就会成功」这类搭配出现的频率极高,所以「成功」被排在了概率分布的最前面。

换句话说,模型的输出反映的是统计规律,而不是它对"认真"这件事的感受。它见过足够多的句子,知道在大多数语境下,人们习惯把"认真"和"成功"连在一起。

孩子的答案为什么不同

孩子给出的「有趣」,在训练语料里大概率不是高频搭配。这个答案来自个人体验和感性认知,而不是对海量文本的统计归纳。作者用这个对比说明,大语言模型的底层逻辑是概率分布,这种统计学规律与人类尤其是儿童的感性认知之间存在明显差异。

模型倾向于输出训练数据中高频出现、符合大众逻辑的词汇,而不是带有个人特质的感性词汇。这不是模型"选错了",而是它的工作机制决定了它会往概率最高的方向走。

原理就藏在这一件事里

作者在文中给出的判断是:大语言模型的全部原理,就藏在「猜下一个词」这件事里。一个孩子的回答和一个模型的回答之间的差距,恰好把这条原理摆到了台面上——一边是体验,一边是概率。