Colin Frasier在Bluesky上发了一张图,是他两年前用GPT-4o做的一个实验:让模型算加法,但答案必须用英文单词写出来,数字越加越大。他当时觉得GPT-4o没作弊去调计算器,因为错得太多了。
有人被这个实验勾起了兴趣,决定在本地硬件上重跑一遍。用的是一台DGX Spark,模型换成了Qwen3.8-27B-Q4_K_M.gguf,通过Codex Remote会话(GPT-6 Astra)把Frasier那张图粘进去,让模型照着做同样的测试。
先关掉推理,再打开推理
第一轮测试,推理功能是关闭的。每个数字组合跑30次,结果做成了一张热力图。第二轮,推理功能打开。这次每个组合只跑一次,因为每对数字的耗时明显变长。只跑一次意味着每个格子要么全对要么全错,热力图看起来远不如第一轮好看。
结果呢?169次尝试里,它答对了167次。
因为这是一次性测试,没有重复采样,所以这个数字本身有波动空间——再跑一遍,结果大概率会不一样。但167/169这个比例,已经足够说明推理开关带来的差异有多大。
推理打开时,模型在算什么
报告里附上了一些大数计算的推理轨迹。有一段是这样的:模型先写下两个数字,4,299,366,105,622和6,088,794,067,970,然后说“等等,让我更仔细地重做一遍”。
接着它把两个数逐位对齐,从右往左加:个位2+0=2,十位2+7=9,百位6+9=15,写5进1……一位一位往下推。
这就是推理打开后模型在做的事——它没有直接吐答案,而是把竖式加法拆成一步步的文本,像小学生在草稿纸上列竖式一样。关掉推理,这个过程就没了,模型只能靠“直觉”报数,大数加法自然错得离谱。
这个实验真正测的是什么
表面上看,这是在测模型会不会做加法。但加法本身对模型来说不是难点,难点在于“用英文单词输出答案”这个约束。模型得先算出数字结果,再把每一位数字转成对应的英文单词拼出来,中间任何一步出错,最终答案就是错的。
Frasier当初用GPT-4o做这个实验时,特意强调模型没作弊——它错得太多,不可能是偷偷调了计算器。这个判断逻辑本身就很有意思:错误率成了“没作弊”的证据。
而这次在本地硬件上重跑,变量控制得更干净。同一台机器,同一个模型文件,唯一的区别就是推理开或关。167/169和第一轮那张热力图之间的差距,把推理功能的价值直接摆在了台面上。
它只记录了一次在DGX Spark上的本地实验,以及一个关掉推理就崩、打开推理就稳的27B模型。
热门跟贴