来源:市场资讯

(来源:科技行者)

打开网易新闻 查看精彩图片

这项由德克萨斯大学奥斯汀分校纽约大学联合开展的研究,于2026年8月以预印本形式发布,论文编号为arXiv:2608.03506。研究聚焦于大型语言模型在因果推理任务中的一个棘手难题,提出了名为CALVER的解决方案,为AI推理系统的可靠性带来了新的思路。

说到底,这项研究要解决的问题,其实可以用一个日常生活场景来理解。假设你在组织一场投票,大家都在挑选今天晚饭吃什么。正确答案有很多——披萨、意面、沙拉都完全可以。但因为大家分散投票,每种正确答案只得到一两票,而那份实际上大家都不怎么想吃的外卖套餐,却因为有几个人凑巧都选了它,反而赢得了最多票数。于是,明明大多数人都认同"正确答案",投票结果却给出了一个"错误答案"。这就是研究团队发现的AI推理系统中一个非常真实的问题。

一、投票制度为何在这里失灵

当前最流行的AI推理方法之一叫做"自洽性"(self-consistency)。它的工作原理类似于让AI同一道题做好几遍,然后看哪个答案出现次数最多,就采纳哪个。这个方法背后的逻辑很直觉——如果大多数尝试都得到同一个结果,那个结果很可能是对的。

这套逻辑在很多场合确实管用,比如数学计算题通常只有一个正确答案,正确的解题路径会集中在同一个数字上。然而,因果推理这类问题天生就存在"多个正确答案"的情况。

以因果推理中最经典的一类问题为例:给你一张描述变量之间影响关系的图(专业上叫"有向无环图"或DAG),然后问你,要想准确估计变量X对变量Y的影响,应该同时控制哪些其他变量?这类问题在医学研究、经济分析等领域非常常见——比如要研究一种药物的疗效,需要控制哪些混淆因素?

关键在于,这类问题往往有不止一个正确答案。控制变量Z1是对的,控制Z2也是对的,同时控制Z1和Z2还是对的。三种不同的答案字符串,背后说的都是完全合理的解法。

当AI被要求做同一道题八次时,它可能给出三次包含Z1的答案、两次包含Z2的答案、两次同时包含Z1和Z2的答案,以及一次什么都不控制的错误答案。按照投票规则,"空集"(什么都不控制)反而成了出现次数最多的单一选项,尽管它是唯一错误的答案,而正确答案的总票数占了七成。

研究团队通过数据验证了这一现象的普遍性:在他们收集的问题样本中,有39%的情况下,无效答案成为了单一出现次数最多的答案,即便问题的候选答案中明明有正确选项存在。

二、因果推理究竟在研究什么

在深入理解这项研究的解决方案之前,有必要简单了解一下"因果推理"是什么,以及为何AI在这方面容易翻车。

因果推理关注的不只是"A和B同时发生"(相关性),而是"A是否真正导致了B"(因果性)。这是统计学和AI领域中一个非常深刻的区别——冰淇淋销量上升和溺水事故增加同时发生,并不意味着吃冰淇淋会导致溺水,二者都源于共同原因:夏天天气热。

判断真正的因果关系需要用到一套严格的数学工具,其中最核心的来自统计学家朱迪亚·珀尔(Judea Pearl)的工作。珀尔提出了一系列图形化标准,用来判断哪些变量需要被"控制",哪些路径传递了真实的因果信号,哪些只是表面的统计巧合。这些标准包括研究中提到的"d-分隔"(判断两个变量在给定条件下是否独立)、"后门调整"(找到正确的控制变量集合)以及"干预图"(模拟强制改变某个变量时系统的行为)。

这些标准有一个重要特性:它们是可以被计算机精确执行的算法。给定一张描述变量关系的图,计算机可以确定性地判断某个答案是否合法——不需要靠感觉,也不需要依赖经验,完全可以用代码计算出来。

研究团队正是抓住了这一特性,设计出了他们的解决方案。

三、CALVER:一位严格的阅卷老师

CALVER的全称是"因果公理级验证"(Causal Axiom-Level VERification)。它的核心思想用一句话说:不要数答案出现了几次,而要检验每个答案是否真的满足因果推理的数学标准。

可以把它理解为一位严格的阅卷老师。这位老师不在乎"三个同学都写了答案A",她只关心:答案A根据题目中给出的因果图,在数学上是不是一个有效的解?答案B呢?答案C呢?找到所有通过检验的答案,从中选择得分最高的那一个。

具体来说,CALVER对AI给出的每一次推理过程进行六个维度的检查。第一,AI是否正确读取并解析了题目中的因果图?第二,AI是否准确识别了题目想问的是什么(治疗变量、结果变量、任务类型)?第三,AI提出的策略(比如某个控制变量集合)在数学上是否真的满足因果有效性条件?第四,AI的推导过程中是否使用了正确的操作类型,格式和来源是否合规?第五,AI报告的计算结果能否经得起独立重新计算的验证?第六,AI最终给出的答案是否与它自己的计算结果一致?

每个维度通过就得一分,总分六分,选择最先达到最高分的那个推理过程所对应的答案。整个过程完全不需要知道"正确答案"是什么,纯粹依靠因果推理的数学规则进行判断。

这一系统有一个非常实际的优势:计算成本极低。每个候选答案的评分只需要在普通CPU上运行1到8毫秒,整个评分过程相比已经花费的AI推理成本,仅增加约7%的额外开销。

四、数字说话:CALVER的实际表现

研究团队在一个叫做CLEAR的基准数据集上进行了测试,专门挑选了那些存在多个有效答案的因果推理问题,共126道题,每道题让AI做8次,最终形成1111个"问题-推理"单元的对比实验。

在这个测试中,普通投票方法的正确率约为31%,一个更聪明的集合相似度投票方法(考虑答案内容而非纯文字匹配)约为31%,AI模型自己对答案的信心评分约为30%,一个专门训练的奖励模型约为31%,让另一个大型语言模型当裁判员约为27%,而CALVER达到了42%。

这18到19个百分点的差距,在实际意义上相当可观。研究团队还做了一个更有说服力的对照实验:他们设计了一个"只检查格式不检查内容"的对照版本,保留了CALVER的所有解析和格式检查步骤,但去掉了因果有效性的语义判断。这个对照版本的正确率只有23.5%,甚至低于普通投票。这直接证明了提升效果来自因果推理的数学判断本身,而不是什么格式或顺序上的技巧。

把另一个AI模型升级到720亿参数充当裁判员会不会更好?答案令人意外——720亿参数的AI裁判员与普通投票相比几乎没有差别(仅提升0.4个百分点,且统计上不显著)。这说明单纯增大模型规模,并不能解决"多个正确答案导致投票失灵"这一根本问题。

五、随着尝试次数增加,差距越来越大

一个特别有趣的发现是,CALVER相对于普通投票的优势,随着AI尝试次数的增加而持续扩大。

当AI只做1次时,两种方法自然是一样的。当AI做2次时,CALVER领先约7.7个百分点;做4次时领先约10.6个百分点;做8次时领先约14.3个百分点;做16次时领先约19.1个百分点;做到32次时,差距扩大到了25.4个百分点,而此时普通投票的准确率已经停止提升,卡在32.5%一动不动。

这个现象背后的逻辑很清晰。普通投票随着尝试次数增加,越来越确定地选中那个"出现最多次的单一答案",而那个答案往往是无效的。CALVER则随着尝试次数增加,越来越有机会碰到至少一个通过全部六项检查的高质量推理过程。两种机制一个在自我强化错误,一个在持续积累正确信号,差距当然越来越大。

六、理论保障:为什么这种方法在数学上是可靠的

研究团队不只是做了实验,还从数学上证明了CALVER的可靠性。

他们给出了两个定理。第一个定理证明:在供给了正确的因果图和观测数据的前提下,如果某个推理过程通过了CALVER的完整检查(包括一些额外的安全条件),那么它给出的关于"某种干预是否有效"的判断,一定是正确的,而且不需要事先知道答案是什么。

第二个定理从数学上证明了投票为何会失灵。它说:假设有一个无效答案,其出现概率比任何单个有效答案都高出一个固定量。那么随着尝试次数增加,投票选出有效答案的概率会以指数级速度趋向零。具体来说,如果有效答案的总概率是60%,均匀分布在4种不同的正确说法上,而无效答案占了40%,那么投票会越来越确定地选出那个无效答案,尽管大多数推理结果实际上是对的。

研究团队还构造了一个精确的数学模型,描述CALVER在有限次尝试下的精确行为,并证明了随着尝试次数增加,选中正确答案的概率单调上升,上限由"候选答案中至少有一个正确答案的概率"决定。

七、超越因果图:从文字中构建图,以及其他领域的测试

一个自然的疑问是:现实中很多问题不会直接给你一张干净的因果图,而是用文字描述各种关系。CALVER在这种情况下还管用吗?

研究团队设计了三个层次的文字难度测试。第一层是"边陈述式"文字,直接逐条列出变量之间的因果关系,难度接近直接给图。第二层是"机制描述式"文字,描述变量之间的运作机制,但不给出边列表。第三层是"自然叙事式"文字,像普通文章一样描述关系,还夹杂着干扰信息。

结果显示,在第一层文字中,AI准确还原整张图的比例是83%,CALVER相对投票提升了24.2个百分点。在第三层文字中,整图还原率下降到了34%,但CALVER仍然相对投票提升了17.6个百分点。这背后的原因正是研究团队在理论部分所分析的:一个推理过程不需要还原整张图,只需要正确把握与当前问题相关的那几条因果关系,就足以给出正确答案。即便整体还原率很低,问题相关的局部信息往往仍然被保留了下来。

研究团队还在两个完全不同的领域测试了这一方法的通用性。一是"骑士与无赖"谜题(Knights and Knaves),这是一类经典逻辑谜题:有若干人,有人永远说真话,有人永远说谎,根据他们的陈述判断每个人是哪种。这道题有唯一正确答案,可以用真值表计算机械地验证。研究团队把CALVER的因果图判断换成真值表验证,在三人、四人、五人规模的谜题上,相对投票分别提升了27、37和16个百分点。

二是用一个独立实现的"do演算证明器"(DoVerifier)来验证候选答案,让每个候选的推理表达式去尝试被证明,选最先能被证明的那个。这个方法完全独立于CALVER的检查器,却体现了同样的核心逻辑——候选式验证,而不是频率投票。在240道因果识别题上,从第一次采样的49.6%准确率提升到了80%。

八、在十个独立贝叶斯网络上的验证

除了CLEAR数据集,研究团队还在十个来自bnlearn(一个标准贝叶斯网络仓库)的独立网络上做了测试,这些网络涵盖医疗诊断、天气预测、保险风险等多个领域,节点数量从十几到七十多个不等。

总体上,CALVER相对投票提升了17.1个百分点。十个网络中有七个出现了明显提升,三个没有变化。研究团队分析,没有变化的三个网络中,候选答案池里所有高分候选的正确性本来就相同,重新排序没有改变最终结果——这正是理论预期的行为:当候选池里没有"正确与错误混杂"的情况时,任何选择方法都一样。

九、什么时候应该用不同的方法

研究团队诚实地指出了CALVER的适用范围,以及在哪些情况下应该选择其他方法。

当文字描述非常精确,可以可靠地从中提取出一张完整的因果图时,更好的选择是把这张图提取出来,然后直接用算法求解,而不是在候选答案之间做选择。在文字最清晰的第一层测试中,提取一张图再直接求解达到了92.8%的准确率,高于CALVER的83.7%。

当答案空间非常紧凑,几乎只有一个正确答案时,投票本身就已经足够好,CALVER的额外计算也不会带来多少收益。研究团队在另外两个数据集(CLadder和Corr2Cause)上验证了这一点,这两个数据集的答案都是简单的二元判断,CALVER与普通投票的差异几乎可以忽略不计。

简而言之,CALVER最有价值的使用场合,是介于这两者之间的中间地带:问题有多个合法答案,但文字描述又没有精确到可以可靠地一次性提取整张图。

十、研究的边界与局限

研究团队在论文中坦率地说明了这项工作的边界。CALVER只从已有的候选答案中做选择,它无法凭空创造更好的答案。其正确率的上限,由候选答案池中是否包含正确答案来决定——如果AI在所有尝试中都没有产生过正确答案,CALVER也无能为力。

此外,在需要从文字重建因果图的场景中,CALVER评分是基于AI自己构建的图,而不是真实的图。这意味着如果AI误读了文字,评分可能针对一张错误的图进行,结论在逻辑上是一致的,却与真实世界不符。

研究团队的理论保障也是有条件的:当提供的因果图和观测数据本身是正确的,且满足某些统计条件时,CALVER才能给出可证明的正确判断。现实中的因果图往往来自对世界的简化模型,本身可能就不完全准确,这一点需要使用者自行评估。

归根结底,这项研究揭示了一个关于AI推理的重要规律:当正确答案不唯一时,"少数服从多数"的投票逻辑会系统性地偏向错误。不是因为AI不够聪明,而是因为聪明分散了——多种正确的思路各自成为了少数派,反而让一种集中的错误思路占了便宜。解决这个问题的关键,不是让AI更努力地投票,而是给它一套能够直接判断"这个答案合不合理"的规则,完全绕开计票的游戏。

这个思路本身并不复杂,但它指向了一种更普遍的可能性:只要一个领域有可以被计算机执行的正确性标准,就可以用类似的方法替代投票,在更多情况下选出更好的答案。逻辑谜题如此,因果推理如此,或许代码验证、数学证明、合同审查也有类似的机会。感兴趣的读者可以通过论文编号arXiv:2608.03506查阅完整研究细节。

Q&A

Q1:CALVER是什么方法,它和普通AI投票有什么区别?

A:CALVER是一种基于因果推理数学规则的候选答案验证方法。普通投票统计哪个答案出现次数最多,而CALVER对每个候选答案从六个维度逐一检查其逻辑合理性,选出最先通过所有检查的答案。核心区别在于:投票看频率,CALVER看有效性,后者不需要知道正确答案是什么。

Q2:为什么增大AI模型规模不能解决多个正确答案导致的投票失灵问题?

A:投票失灵的根本原因是多个正确答案把选票分散了,让一个集中的错误答案反而胜出。这是聚合机制本身的逻辑缺陷,与模型大小无关。研究实验证明,720亿参数的AI裁判员相比普通投票仅提升0.4个百分点,因为它同样依赖频率或偏好判断,没有从根本上改变投票的逻辑。

Q3:CALVER在什么类型的问题上效果最明显,在什么情况下没有帮助?

A:CALVER在因果推理中存在多个合法答案的问题上效果最明显,比如寻找有效控制变量集合或d-分隔节点集。当答案空间非常紧凑、几乎只有一个正确答案时,CALVER与普通投票差异很小。当文字描述精确到可以可靠提取完整因果图时,直接提取图并算法求解反而更准确。