一道数学题摆在面前,GPT-4o 能轻松解出答案,但当题目本身藏着一个条件矛盾时,它还能发现吗?北京大学 DCAI 团队的最新研究给出了一个值得警惕的答案:解题能力和验证能力,在大模型身上是两回事。

随着合成数据大量涌入训练集,数学题目中混入条件缺失、逻辑矛盾等隐性错误的风险日益突出。这些错误一旦进入训练流程,就不再只是单条样本的问题,而可能变成模型反复学习的推理习惯。北大团队提出的 MathDebugger 基准,正是为这类"带病"数学题做的一次系统性体检。

打开网易新闻 查看精彩图片

七类错误,四维评测

MathDebugger 覆盖了 4,000 道题目2,000 条标注答案,将错误细分为七类:题目侧包含表达错误、条件缺失、条件矛盾、不现实设定;答案侧包含逻辑错误、计算错误、表达错误。评测协议则设计了四个任务:题目正确性检测、题目错误类型分类、答案正确性检测、答案错误类型分类。

这套双阶段设计模拟了真实的数据清洗流程——题目本身无解或条件冲突时,后续答案评测就没有意义。只有题目先通过检查,才进入答案评测环节,避免了因题目缺陷导致的误判。

解题强,验题弱

实验结果揭示了一个明显的落差。GPT-4o、DeepSeek-R1 等强模型在解题任务上表现优异,但在答案错误类型分类任务上,Macro F1 仅约 55,而题目正确性检测可达 70 以上。更值得注意的是,经过数学微调或擅长长链推理的模型,在验证任务上并不稳定优于通用模型——单纯提升解题能力,不会自动带来验证能力的提升。

这种"会做题"与"会验题"之间的差距,被研究团队称为 solving versus verifying gap。它意味着,当前模型对数学数据质量的把控能力,远未达到其解题能力的水平。

错误标签是有效的修复信号

研究最有实用价值的部分在于:当向模型提供真实的细粒度错误类型时,纠错准确率会稳定提升。GPT-4o 在条件缺失任务上从 49.2% 提升至 53.9%,DeepSeek-R1 从 52.1% 提升至 55.6%,两者在条件矛盾类错误上均有约 2.1 个百分点的提升。

这说明精准的错误分类比单纯的"对错判断"更具修复价值。与其告诉模型"这题错了",不如告诉它"这题缺了一个条件"——后者能真正驱动模型修正自己的推理轨迹。

数据质量的可控性

为了保证基准本身的可靠性,研究团队使用了 STEM 背景标注者和复核者进行多轮检查,错误类型层面的 Fleiss' κ 达到 0.69 到 0.91,分类标准具有较好的一致性。答案侧错误分布也更接近自然分布(逻辑错误 314 条、计算错误 232 条、表达错误 64 条),而非人为均衡,使评测结果更具真实性。

MathDebugger 的价值在于,它将"题目是否成立、答案是否可靠、错误能否定位、修复是否有效"变成了一套可量化、可持续评测的完整闭环。只有当模型能够识别条件冲突、定位推理偏差,并借助错误标签修正答案,数学领域的合成数据才真正从数量堆砌走向质量可控。