打开网易新闻 查看精彩图片

当大语言模型在逻辑题上给出错误答案时,我们通常会下一个很快的结论:它不会做这道题

但这个结论真的可靠吗?

想象一下:学生已经在草稿纸上写出了正确推导,交卷时却把答案栏涂错了。只看答题卡,我们会说他 “不会”;如果能同时检查草稿,就会发现问题出在最后一步的表达。

北京大学研究团队 和 易鑫(YIXIN)AI Lab 围绕大模型推理评测与内部表征展开合作,共同追问一个看似简单、却可能影响我们解读 Benchmark 结果的问题:

当模型答错一道逻辑题时,它是真的没有想出来,还是已经想到了,却没有把正确答案表达出来?

这项研究提出了一个专用于大模型的诊断视角:模型很可能已经在隐藏状态(Hidden States)中编码了正确答案,却在将其转换为最终候选分数的过程中,被输出层的系统性偏差给 “掩盖” 了。作者将这一现象命名为“读出瓶颈”(Readout Bottleneck),并设计了一套分阶段的诊断方法来验证 “答错” 究竟是能力缺失,还是表达失真。

该工作已被自然语言处理顶级会议EMNLP 2026 主会接收(录取率 15.4%)

打开网易新闻 查看精彩图片

  • 论文题目: Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores
  • 作者: Qiyao Yan、Chenpeng Wang、Liangming Pan
  • 合作单位: 北京大学、易鑫(YIXIN)YiXin-AILab
  • Arxiv 链接:https://arxiv.org/abs/2608.31068

1. 一个常被忽视的混淆:答错,真的等于不会吗?

在目前的逻辑推理评测(多选题或固定选项)中,标准流程非常统一:1)输入题干 ,2)计算每个候选答案的 Logit 分数,3)取最高分项 ,4)统计准确率。大家习惯性地将最终得分低,等同于 “模型缺乏该项推理能力”。

但作者团队指出,这里存在一个被长期混淆的因果断裂:模型最终输出错误,究竟是因为内部根本没推导出来,还是推导出来了,却在最后一步的输出映射中被 “读坏了”?

打开网易新闻 查看精彩图片

图 1:论文的三步诊断链。关键问题不是 “模型最后选了什么”,而是 “正确答案的信息在哪一步丢失了”。

为了把这两者彻底拆开,作者在不同难度梯度的测试集上(包括基础同分布的id、考查更长推理链的depth、以及替换了词汇表达的困难切片lexical-OOD),对模型推理过程中的不同 “读出” 节点进行了对比:

  • 隐藏状态早已 “知道” 答案:不管是在提示词刚结束时(Prompt-end probe),还是在紧接着 Answer: 标记之后的节点(Answer-slot probe),线性探针都能以极高的准确率解码出正确答案。以 Qwen3.5-9B 在最难的 lexical 切分为例,此时探针准确率高达 0.830。
  • 两段式的 “表达坍塌”:然而,当这股正确的逻辑信息流经模型固有的词表矩阵(Same-position label logits)时,信号开始大幅衰减至 0.574。更致命的是,哪怕模型在预测第一个词元时(First-label-token score)还勉强保留了一丝优势,一旦将整个候选短语的对数概率进行累加(Full string score),误差就会被无限放大,准确率瞬间跌至 0.333—— 彻底沦为三分类的完全盲猜。

在 Qwen3.5 系列模型 的受控逻辑测试(Lexical-OOD)上,对比结果如下:

打开网易新闻 查看精彩图片

表1:Qwen3.5 模型不同“读出”方式的准确率对比。

当在模型输出答案标签前接入线性探针(Linear Probe)时,探针能以极高的准确率(如 Qwen3.5-9B 在 lexical-OOD 切分上达 0.830)解码出正确答案。然而,当这股信息流经词表投影,聚合成最终候选序列分数时,准确率却断崖式下跌至 0.333(等同于三分类的随机盲猜)。模型并非逻辑推导失败,而是被输出层的系统性结构偏置(如偏好 “unknown” 等安全标签)掩盖了真实判断。

更夸张的是,在原生序列打分下,Qwen3.5-9B 在 1,000 道测试题中竟有999 道被判为了同一个标签(unknown)。这显然不是每道题都在逻辑上遭遇了独立失败,而是输出层存在一个极强的全局偏好,把样本之间的实例级逻辑差异硬生生碾平了。

甚至在未经任何指令微调的原始底座模型(Base Model)上,这一现象依然稳固存在(Qwen3.5-9B-Base 探针 87.3%,序列打分仅 36.1%)。

核心结论:模型的推理信号并未在深层消失,但从内部隐变量走向原生词表与序列累加的过程中,存在一个严重的读出瓶颈(Readout Bottleneck)。

2. 极简修正:只动 2 个参数,唤醒被 “封印” 的推理能力

如果原生序列分数真的只是一层被 “全局偏置” 扭曲的信号,那它内部是否还残留着针对具体题目的相对排序?

论文提出了一个判定逻辑:将候选分数的生成过程解构为两部分:

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

在三分类任务中,固定一个基准项后,自由参数仅仅剩下 2 个。这两个参数完全在无标签的上下文分数上,通过网格搜索使其预测分布贴合类别先验(如均匀分布)完成拟合,随后直接在独立的 Held-out 测试集上冻结评测。

这种干预的能力上限被死死限制住:

  • 它只有 2 个参数,绝不可能学会复杂的 “输入 - 推理 - 输出” 任务映射;
  • 它是全局常数平移,不可能改变同一个类别内部不同样本的相对好坏。

如果这区区两个参数能在测试集上救回大量错题,唯一的解释就是:模型给出的原始分数差值里,本来就保留着正确的相对排序证据。

打开网易新闻 查看精彩图片

图 2:灰条为原生序列准确率(虚线为 1/3 随机线),蓝条为两参数无标签先验修正后成绩;下方绿条展示逐样本净拯救数(校准单独答对数减去原生单独答对数)。

实验在四大推理任务上展现出惊人的一致性:

  • Synthetic 逻辑任务:Qwen3.5-4B 与 9B 的准确率从 33.3% 盲猜直接拉升至 57.0% 和 60.2%,净挽救错题超过 230 道;
  • ProofWriter 自然语言演绎:模型从完全坍塌的 33.3% 暴涨至 65.3% 和 67.8%,单任务挽救了超过 320 道原本判错的题;
  • FOLIO 与 ANLI 进阶推理:即使面对高度复杂的一阶逻辑与对抗性 NLI,修正依然带来了 9 到 29 个百分点的稳健恢复。

打开网易新闻 查看精彩图片

更关键的是样本效率(Sample Efficiency):因为拟合的只是极低维的偏置,在 30 次随机子采样中,仅需 25 个无标签样本,Qwen3.5 就能找回绝大部分丢失的准确率,继续追加数据至 1,000 个时表现基本饱和。这彻底排除了 “修正是在暗中重新学习任务” 的假说。

3. 严格因果对照:排除 “作弊” 与 “幻觉”

面对 30 多个百分点的回弹,审慎的研究者必然会追问:这会不会只是投机取巧?比如利用了词汇重叠的浅层捷径,或者仅仅是把预测直方图强行拉平带来的运气?

作者在论文中通过两道最严苛的对照控制,封死了所有的替代解释:

打开网易新闻 查看精彩图片

图 3:A 组针对词袋分类器(TF-IDF)失效样本的恢复情况,红点标出高出置换零假设的净差距;B 组展示 ProofWriter 随推理深度增加的切片测试。

控制一:专打浅层捷径的 TF-IDF-missed 难例切片

大模型常被质疑是 “聪明汉斯(Clever Hans)”,通过前提与假设之间的表面词汇重叠来投机猜题。 作者用词袋模型(TF-IDF)作为过滤器,将所有仅凭浅层词汇重叠就能做对的样本全部剔除,只留下纯靠词汇线索做不对的硬核难题。 在这些难例切片上,Qwen3.5-4B/9B 的修正后准确率依然稳定维持在62.2%65.1%。这证明找回来的决定是扎扎实实的语义演绎,与表面字面重叠无关。

控制二:保持标签总数的随机置换检验(Count-preserving Permutation Null)

打开网易新闻 查看精彩图片

不过该方法仍然存在一些局限,论文明确列出了三类失效的边界场景:

打开网易新闻 查看精彩图片

4. 结论:别让最后一个结果 Token,轻易否定模型的全部推理

这项研究为社区审视 Benchmark 评测方式提供了一个新的视角:大模型的 “内部推理能力” 与 “外部表达通路” 从来都不是同一件事。当评测强行将多步逻辑压缩成单个分类词(Token)的生成打分时,静态线性层(Unembedding)的几何错位与序列打分的累加偏差,极易成为掩盖模型真实智能的 “读出瓶颈”。

这也为思维链(Chain-of-Thought)为什么在长逻辑上更有效提供了一个新的机理注解:让模型通过多步 Token 逐步吐出思考,本质上是将单步输出层沉重的读出负担分散到了序列的演化路径中,从而有效绕开了瓶颈扼杀。

在大模型评测榜单日益泛滥、大家对分数分毫必争的今天,这项工作给出了一个更严谨的视角: 当看到模型在一个任务上给出接近盲猜的分数时,不要急着判定它 “不会做”—— 先看一眼它的隐藏状态。也许模型早就在 “草稿纸” 上算对了全部逻辑,只是最后在 “涂答题卡” 时,被输出层的一点偏置带偏了而已。