大模型数学题能做对,不代表它真懂数学。一项新研究用知识空间理论检验了八款开源与闭源模型,发现它们的数学知识缺乏连贯结构,只是准确率看起来漂亮。
准确率掩盖了什么
打开网易新闻 查看精彩图片
研究指出,这些模型经常违反知识依赖关系。比如一个模型能解高阶方程,却搞不定它本应依赖的基础运算。这种断裂在只看最终答案对错的评估里完全看不见。
模型之间也各说各话
更麻烦的是,八款模型彼此的知识分布重叠度很低。同一道题,A模型和B模型掌握的知识点几乎不重合,说明它们学到的东西没有形成共识性的数学体系。
研究强调,基于准确率或让大模型当评判的评估方式,都测不出这些缺陷。数学能力评估需要换一套能检查知识结构的方法,而不是继续盯着分数。
热门跟贴