这项由香港科技大学(广州)、香港大学、清华大学及萨塞克斯大学联合开展的研究,以预印本形式于2026年7月30日发布,论文编号为arXiv:2607.28374,有兴趣深入探究的读者可通过该编号在arXiv平台查阅完整原文。
**一、一个让人头疼的老问题:AI答对了,但理由全是胡编的**
当你雇了一名侦探帮你调查案子,他最终给出了正确答案——凶手确实是那个人。但当你问他"你是怎么查出来的",他开始跟你描述一堆根本不存在的证据:"我在现场发现了一枚刻着凶手名字的金币","目击者告诉我他当晚穿的是红色大衣"……而这些证据从来没有出现过。你会相信这个侦探吗?
这正是当下AI视觉问答系统面临的核心困境。现代多模态大语言模型(简单说就是能同时看图又能读文字的AI)已经越来越擅长回答复杂问题,从识别图片里的文字、数物体数量,到结合网络搜索做多步推理,它们表现得相当出色。然而,研究者发现了一个令人不安的现象:就算最终答案是对的,AI在得出这个答案的过程中,往往夹杂着大量根本没有依据的中间推断,甚至会"假装"引用了某条证据,实际上那条证据里根本没有它所说的内容。
过去,评估AI好不好用的主要标准就是"答案准不准",就好比只看侦探最后有没有抓到凶手,完全不管他用了什么手段。这种粗放的评估方式掩盖了大量隐患,尤其是在需要高度可信度的场景下——医疗诊断、法律分析、教育辅导——如果AI说的每一步推理都可能是虚构的,那这个"正确答案"到底值多少钱?
正是为了解决这个问题,研究团队提出了一套名为LedgerMind(可以把它理解为"带账本的推理大脑")的框架。这套系统的核心思路是:给AI的每一步推理过程建立一本严格的"证据台账",任何推断都必须有台账里的实际证据支撑,绝不允许无中生有。
**二、四种让人防不胜防的推理陷阱**
在深入了解LedgerMind的工作方式之前,有必要先认识一下它所针对的四种典型失误,因为正是这四种问题促使研究团队下定决心设计这套系统。
第一种陷阱,研究者称之为"轨迹忠实性缺口"。这说的是:AI给出了正确答案,但中间的推理过程里混入了大量无依据的声明。好比侦探碰巧猜中了凶手,但他的推理笔记里写满了从未发生过的事。最终结果蒙对了,过程却漏洞百出。
第二种陷阱更加隐蔽,叫做"幻象引用"(研究团队给它起了个更正式的名字:Phantom Grounding)。这种情况下,AI确实引用了某条证据编号,格式上看起来完全合规,但当你去查那条证据的实际内容时,会发现AI从中"读出"了根本不存在的实体或数字。这就像侦探说"根据证物袋3号的刀,我判断凶手身高一米八",但你去看证物袋3号,里面装的是一枚纽扣,跟身高毫无关系。引用的编号是真的,但从那条证据推出来的结论是凭空捏造的。
第三种陷阱叫"过度推理悖论"。研究发现,对于一些本来很简单的问题,AI反而倾向于把问题复杂化,搜索一大堆资料、经过好几轮推理,最终反而得出错误答案,把一开始就能直接看出来的正确答案给"推翻"了。这就像你问朋友"苹果是什么颜色",他非得去查一堆植物学文献,最后告诉你"根据花青素的合成机制,颜色判断存在不确定性"……
第四种陷阱出现在"修复"阶段,叫"修复放大效应"。当AI发现自己的推理有问题,试图自我修正时,它往往在修正旧错误的同时引入了新的无根据内容。就好比你让侦探修改调查报告,他删掉了一个不存在的证据,却又凭空加上了一段从未发生的目击者证词。修了一个洞,开了两个新窟窿。
**三、证据台账:从一盘散沙到有迹可查**
明白了这四个陷阱,LedgerMind的设计逻辑就变得清晰起来。整套系统的核心是一本"结构化证据台账",可以把它理解为一本严格管理的案件证据登记册。
在传统的AI推理框架里,整个思考过程被存储为一段连续的文字记录,工具输出、AI的理解、推断的事实、修改后的说法全部混在一起,就像把所有的案件笔记、证据照片、目击者陈述、侦探的猜测全部混在一个纸盒子里,谁也分不清哪些是真实证据,哪些是侦探的个人推断。
LedgerMind的台账彻底改变了这种做法。每当AI调用一个工具获得信息(比如对图片做文字识别、做网络搜索、对图片某个区域做放大分析),这条信息就会被标准化后以一个正式条目的形式登记入册。每个条目有十一个字段,包括:这条信息从哪个工具来的、它的类型(是直接感知到的信息、检索来的资料、还是从其他证据推导出来的)、可信度评分、当前状态(有效、过期、有争议、已废弃),以及有哪些后续推理引用了它。
台账上的事实,必须通过确定性的工具映射方式来获取——比如OCR工具读取的文字就是文字,搜索工具返回的片段就是片段——而不是由AI用自己的语言"转述"一遍。这个区别至关重要:转述的过程本身就可能引入幻觉,而直接登记原始结果则不会。
台账还要执行四条铁律。第一,每条证据必须来自工具的直接输出或其确定性转换,AI不能自己"创造"证据。第二,任何推断或决策性声明,在能够影响后续推理之前,必须先引用台账里的有效条目。第三,光是引用了编号还不够,声明里的实体名称和数字必须在被引用的证据里实际存在,这条规则专门针对幻象引用问题。第四,修复操作只能改变条目状态或调用工具获取新证据,不能往台账里填入任何没有工具来源的自由文本。
**四、三层核实:从"引用了吗"到"引用对了吗"**
有了台账作为基础,LedgerMind还设计了一套三层核实机制,用来检查AI的每一个声明是否真正得到了证据的支持。
第一层检查的是覆盖率——AI的声明里有多少关键词能在它所引用的证据里找到对应?这是最基础的文本匹配,排除掉常见的虚词和停用词,看实质性的内容词是否有据可查。
第二层是实体一致性检查,专门对付幻象引用问题。检查器会提取AI声明里的所有非数字实体(人名、地名、物品名、品牌名等),然后去被引用的证据池里逐一核对,看每个实体是否真的出现过,或者有公认的别名对应关系。如果AI说"这是阿波罗11号登月牌匾,1969年",但被引用的证据里只提到了阿波罗11号飞船,根本没出现过"登月牌匾"这个词,那这个声明的实体一致性检查就不通过。
第三层是数字一致性检查。对于声明里出现的每一个数值,系统会在证据池里找是否有匹配的数字。对于年份、日期、计数、选项编号这类精确数字,要求完全一致;对于温度计读数、仪表读数这类连续物理量,允许小幅度的误差(比例误差不超过15%),以容忍正常的视觉感知误差。
这三层检查层层递进,任何一层未通过都会降低该声明的可信度评分,使其低于系统设定的核实阈值,从而触发进一步的假设验证流程。
**五、聪明地选择"几步走":不是所有问题都需要大动干戈**
LedgerMind的另一个重要设计是自适应双路径调度器,用来解决前面提到的第三个陷阱——过度推理悖论。
系统会先对问题做一次复杂度分类,决定用"直接路径"还是"完整流程路径"来处理这个问题。判断依据包括五个条件:问题是否涉及精确的视觉读取(比如温度计度数、计数)、是否需要把视觉信息和外部知识结合起来、是否需要核实或多实体比较、是否是多选题格式,以及问题是否是非英文的。只要满足其中任何一个条件,就走完整流程路径;否则走直接路径。
直接路径只使用很小的工具调用预算,适合"图片里有几只猫"这样一眼就能看出来的问题,不做额外的搜索和多步推理,直接给出答案后用少量在线信息做个简单核实就够了。
完整流程路径则是一套完整的作战方案。首先AI在看图之前只看问题文字,规划好要观察哪些视觉元素、用什么推理方法、答案应该具体到什么粒度。然后从图片中提取最多15个细粒度的观察声明,每个声明都要打上语义标签(文字类、数字类、物体类、空间关系类、计数类等),并以设定的置信度0.92登记入台账。
对于需要读取精确数值的问题,系统会在九宫格区域里找最有信息量的子区域,做2.5倍的裁剪放大,然后对同一张裁剪图做两次独立读取(两次API调用互不共享上下文),如果两次读取结果偏差不超过15%,就采信置信度0.97的结果;如果偏差超标,就降低置信度并触发进一步核实。
对于需要外部知识的问题,系统会先做第一轮网络搜索,用图片中识别出的实体名称作为搜索关键词;对于需要深度知识的问题,还会用第一轮搜索结果来精炼查询词,做第二轮搜索。搜索结果会以置信度0.85登记为检索类证据。
完成证据采集后,推理过程被组织成三段式结构:先综合证据模式,再推导逻辑结论,最后给出判断性答案。每个推断都必须引用具体的台账条目编号;没有引用来源的非判断性声明直接丢弃,没有引用来源的判断性声明则降低置信度到0.55,低于核实阈值0.6,自动触发假设核实。
最终决策时,系统还会再次传入图片进行视觉核实,并执行三道防线:如果实体一致性检查失败,强制AI仅使用台账中已确认的可见文字重新作答;如果数字一致性检查失败且是读数类问题,直接用台账中最接近的数值替换;如果答案包含"无法确定"、"不清楚"等不确定性标记,强制AI直接从图片给出具体答案。
**六、修复也要守规矩:七种有限操作替代自由发挥**
传统的AI自我修正机制允许AI用自然语言自由地重写自己的推理过程,而这恰恰是修复放大效应的根源。LedgerMind用事件触发的有类型约束的修复机制取代了这种自由发挥。
核实器会在六种高风险情况下自动触发:工具返回了空结果或错误信息、声明引用了已超时的证据条目、两条高度重叠的证据描述了不同事实、工具输出的置信度低于硬性下限0.3、决策声明的证据覆盖率低于15%、以及引用合规但实体或数字不一致(即幻象引用)。
触发后,修复操作被严格限制在七种有类型的算子之内。在证据层,可以废弃某条证据条目,或者用更新的参数重新调用工具并用新结果替换旧条目。在行动层,可以用调整后的参数重试最近失败的工具调用(比如把裁剪区域偏移一点,或者扩展搜索关键词),可以切换到备用工具(比如从文字识别切换到视觉问答),可以主动获取一段特定证据来填补决策声明的支持缺口。在轨迹层,可以直接以台账中置信度最高的条目作为最终答案终止流程,或者在证据不足且修复预算耗尽时输出"无法回答"。
修复策略遵循"就近优先升级"的原则:工具异常时先重试再切换工具;引用了过期证据时先刷新再废弃;证据冲突时丢弃置信度低的那条;置信度过低时用调整参数重试;决策声明无支撑时主动获取证据;发现幻象引用时注入警告并补充证据。每次触发最多允许2次修复,整条轨迹的总修复成本有上界约束。
这套机制的关键数学性质由论文中的命题1保证:任何修复操作都不会在台账中引入没有工具来源的新内容。"废弃"操作不产生新条目;"刷新"、"重试"、"主动获取"只通过调用工具并对结果做确定性转换来添加新条目;"切换工具"本身不写入台账;"终止"和"放弃回答"不改变台账。因此,修复过程中的每一条新证据都必然有可追溯的工具来源,绝无无中生有的可能。
需要特别说明的是,这个保证不等于说工具输出一定是准确的。工具本身可能出错,但这些错误是有来源、可审计的,不是AI凭空编造的。这是一个重要的区别:有来源的错误可以被发现和追究,而无来源的幻觉则无迹可查。
**七、衡量推理过程的质量:四把不同的尺子**
为了评估AI的推理过程是否真正符合证据规范,而不仅仅看最终答案对不对,研究团队定义了四个专门的指标,可以把它们想象成对侦探工作的四种不同角度的打分。
第一个指标衡量的是推理过程中有多少声明没有证据支撑,只统计AI自己的推断和决策声明,不把工具直接输出的观察结果算进去——因为观察结果只要如实记录工具输出就是可信的,需要重点审查的是AI在此基础上进行的推断。这个指标越低越好。
第二个指标衡量的是最终决策声明有多少比例是有证据支撑的,越高越好。
第三个指标专门针对回答正确的案例,看其中有多少是真正基于有依据推理得出的,而不是碰巧蒙对的。这个指标把"实力派答对"和"运气派答对"区分开来,越高越好。
第四个指标针对回答错误的案例,看其中有多少的决策声明表面上看起来有证据支撑——这正是幻象引用最危险的地方,答案是错的,但推理过程看起来头头是道。这个指标越低越好。
此外,研究团队还定义了几个辅助指标:观察声明的错误率(衡量工具层面的感知噪音)、证据利用率(衡量采集了多少证据被实际用上了,太低说明过度收集了无用信息)、修复成功率,以及步骤效率。
**八、实验结果:这套系统在多个战场上的表现**
研究团队在六个公开基准测试以及一个专门构建的压力测试集Hard-200上评估了LedgerMind,使用了来自四家厂商的六款前沿多模态模型作为底层支撑(GPT-4o、GPT-5.5、Gemini-3-Flash、Gemini-3.1-Pro、Claude-Sonnet-4.6、Claude-Opus-4.7、Kimi-K2.6),并与每款模型自身的原生链式思考输出做对比,保持工具调用预算完全一致,以排除额外计算量的影响。
在VTC-Bench(一个专门考察AI如何调用视觉工具链的综合测试)上,LedgerMind配合Gemini-3-Flash达到了58.9%的总分,超过了包括GPT-o3、Gemini-2.5-Pro等在内的所有已知对比系统,取得了当时的最优成绩。更值得注意的是各模型的提升幅度:Gemini-3.1-Pro提升了11.8个百分点,Gemini-3-Flash提升了12.4个百分点,GPT-4o提升了23.3个百分点。弱模型提升幅度更大,说明这套框架对底层模型的依赖程度较低,具有良好的通用性。
在MMStar、MMMU、MMMU-Pro三个通用视觉语言基准测试上,LedgerMind以GPT-4o和Gemini-3-Flash为底层,在11个对比系统中均排名第一。MMMU-Pro的提升尤为说明问题——这个测试集上的AI系统通常倾向于过度推理,而LedgerMind通过自适应调度器把知识密集型问题引导到直接路径,从源头解决了过度推理带来的准确率损失。
在EMMA(一个考察AI数学、物理、化学、编程多学科图文推理能力的基准测试)上,LedgerMind整体达到58.29%,比最强对比模型(Gemini 3.1 Pro的48.71%)高出9.58个百分点。数学子集提升最多,高出16.15个百分点,物理子集提升16.02个百分点——这两个子集正是最需要精确读图和多步符号推导的,也是幻象引用和修复放大效应最容易出问题的领域。编程子集小幅下降0.18个百分点,研究团队指出这个子集主要考察代码与图表的对应关系,对图像中心的推理要求较低,框架优势在此子集上较难体现。
Hard-200是研究团队专门构建的200道压力测试题,来自三个不同来源:BrowseComp-VL(需要图文结合的多跳检索)、TIR-Bench(细粒度视觉感知和结构化推理)、以及团队自建的RealCAR(真实世界复杂多步推理)。在这个压力集上,LedgerMind对六款底层模型的整体提升幅度在11.2到19.7个百分点之间,所有六款模型、三个子集的全部18个数字无一出现负值,在这个以"难"著称的测试集上展示出全面稳健的提升。其中最弱的底层模型Kimi-K2.6在BrowseComp-VL子集上从19.5%跳升至46.0%,提升了26.5个百分点,这正是实体级核实对抗幻象引用的直接体现。
MC-Search是一个专门考察多模态智能体搜索推理链质量的基准测试,它同时评估最终答案和中间检索步骤——有多少黄金步骤被复现了、步骤数偏差有多大。这个测试直接检验的是推理过程的质量,而非仅仅是结果。LedgerMind配合Claude-Opus-4.7,将F1答案准确率从最优对比系统的41.78%提升至61.28%,将黄金步骤覆盖率从31.35%提升至57.82%,步骤数偏差从0.89降至0.54。更值得关注的是,推理链质量的提升幅度大于答案准确率的提升幅度,并且步骤覆盖率提升的同时步骤数偏差也在下降——这是真实推理路径改善的特征信号,而非只是对最终答案做了后处理。即使是在这个基准测试上最弱的Gemini-3-Flash底层,推理链指标也维持在或超过最优对比系统水平,进一步确认了框架的驱动作用。
**九、轨迹忠实性审计:证明提升来自真材实料而非侥幸**
为了回答"准确率提升是真的推理更靠谱了,还是只是运气更好了"这个核心疑问,研究团队在V\*Bench和一个160题的EMMA子集上做了对称推理忠实性审计。
审计方法是:对每道题同时收集一条原生链式思考轨迹和一条LedgerMind轨迹,交给一个固定的外部评判模型(Gemini-3.1-Pro),让它把每条轨迹分解成最多10个原子声明,并逐一判断每个声明是否有图片中的证据支撑,在原生轨迹和LedgerMind轨迹上使用完全相同的评判协议。
结果在五款底层模型、两个测试集、所有指标上,LedgerMind的雷达图多边形完整地包住了原生模型的多边形——准确率在提升,决策声明有支撑的比例在提升,有真实依据支撑的正确答案比例在提升,而未被支撑推理声明的比例在下降,错误答案中看起来有依据的比例也在下降。其中下降最明显的是最后一个指标,在EMMA子集上尤为突出——原生模型经常给出错误答案,但其决策声明看起来好像有依据,这正是幻象引用的典型表现,而实体一致性检查机制正是专门为拦截这种模式设计的。
**十、缺一不可:拆掉任何一块,整栋楼都会摇晃**
为了验证每个设计模块各自的贡献,研究团队在MMMU-Pro上对Gemini-3-Flash进行了消融实验,保持工具预算完全一致,逐一去掉各个组件。
完整系统的整体得分是68.89%。去掉结构化证据台账后,得分急剧跌至53.50%,下降了15.39个百分点,是所有消融中损失最大的——这说明单靠提示词指令让AI"记得引用证据"是远远不够的,结构性约束是无法用提示技巧替代的。将有类型约束的修复替换为自由的自我反思后,得分降至60.40%,下降8.49个百分点,与修复放大效应的预期一致。去掉实体和数字一致性检查后,得分降至63.70%,下降5.19个百分点,且损失主要集中在"难"题分组上,确认了这两个检查层是对抗幻象引用的关键武器,而不仅仅是结构覆盖检查。去掉双重独立读取验证后,得分降至66.70%,主要影响需要精确测量读数的题目。去掉自适应调度器、强制所有题目都走完整流程后,整体分数仅下降1.49个百分点,但"易"题准确率明显下降,"难"题准确率几乎不变——这正是过度推理悖论的行为特征,调度器的价值在于避免在简单问题上做不必要的深度推理,而不是在困难问题上增加推理深度。
**说到底,这套系统告诉我们什么?**
归根结底,LedgerMind提出的问题比它给出的答案更有意思:一个AI在推理过程中说了什么,和它最终答案是否正确,这是两件截然不同的事,我们长期以来只关注了后者。
这个研究团队把AI的推理轨迹从一团说不清楚的文字变成了一本可以被审计的账本。每一条证据从哪里来、被谁引用了、引用的时候有没有被曲解——所有这些都有迹可查。这不只是让AI更准确,而是让AI的推理变得"可问责"。
这对普通人意味着什么?短期内,你或许感受不到直接影响,但当AI系统被用于帮你解读医疗报告、分析合同条款、辅助学生学习时,推理过程的可信度就不再是无关紧要的背景信息,而是直接关系到你能不能放心采信这个结论。一个能解释"我是这样看出来的,每一步都有图上的文字为证"的AI,和一个只是告诉你"答案是A"的AI,在需要理解和信任的场景下,价值是截然不同的。
研究团队也坦诚地指出了这套系统目前的边界:它是在静态图文问答上做的评估,对于需要长时间记忆、处理视频流或涉及具身交互的场景,台账的时效策略需要重新设计;实体一致性检查目前依赖预设的别名表,跨语言的别名关系和复杂的指代消解还需要更强的实体链接能力;自适应调度器目前是基于规则的,对于更复杂多样的问题分布,学习型的调度策略可能效果更好。
如果你对这套框架的技术细节感兴趣,原论文arXiv:2607.28374提供了完整的算法伪代码、所有提示模板、评分指标定义、阈值选取依据以及分topic/分backbone的详细实验结果,可以在arXiv平台通过该编号免费获取全文。
Q&A
Q1:LedgerMind中的"幻象引用"是什么意思,为什么普通引用检查发现不了它?
A:幻象引用指的是AI确实引用了某条证据的编号,格式上看起来合规,但声明中出现的实体名称或具体数字在那条证据里根本没有。普通检查只验证"有没有引用编号",而LedgerMind的实体一致性检查会进一步核对声明里的每个实体和数字是否真的出现在被引用的证据内容中,所以能发现这种"引用了但内容对不上"的欺骗性情况。
Q2:LedgerMind的"修复不能引入新内容"保证是绝对可靠的吗?
A:这个保证的范围是:修复操作不会在台账里写入没有工具来源的内容,但不保证工具输出本身是事实正确的。比如网络搜索返回的片段可能有错,OCR读取的文字可能因图片质量不佳而出错,这些错误会被记录进台账,但它们有明确的工具来源,可以被追溯和审计,而不是AI凭空编造的内容,这两种错误在可追责性上有本质区别。
Q3:LedgerMind在简单问题上为什么不走完整推理流程?
A:因为对简单问题做多步推理和大量搜索,反而可能引入与问题无关的信息,给模型更多机会在本来一眼就能看出的答案上得出错误结论,这就是研究中所说的"过度推理悖论"。LedgerMind的自适应调度器会先判断问题复杂度,简单问题直接在小工具预算下快速作答,避免不必要的推理深度带来的准确率损失。
热门跟贴