这项由Salesforce人工智能研究院与布朗大学联合开展的研究,以arXiv预印本形式发布于2026年7月13日,论文编号为arXiv:2607.11862,有兴趣深入了解的读者可通过该编号查询完整论文。
当你问一个人"刚才那个视频里,那个人为什么会摔倒",一个诚实的目击者会告诉你:"因为我亲眼看见梯子向后滑动,然后他失去重心。"但如果这个目击者其实没看清楚,他可能会根据常识猜测:"大概是脚滑了?"——两种回答听起来都像模像样,却有着本质区别:一个有真实视觉证据支撑,另一个只是合理推断。
现在的AI视频理解系统,大多数时候扮演的是第二种角色。它们能流畅地回答关于视频的各种问题,却无法告诉你答案来自视频的哪个时间段、画面里的哪些具体物体。这种"只给结论不给证据"的状态,在自动驾驶、手术操作分析、人机协作等高风险场景下是相当危险的——一旦AI答错,你根本不知道它是真的看见了什么,还是在依靠文字游戏猜测。
正是为了解决这个根本性的信任危机,来自Salesforce与布朗大学的研究团队提出了一套全新的框架:**证据支撑的视频问答(Evidence-Backed Video Question Answering,简称E-VQA)**。这套框架要求AI在回答视频问题时,必须同时给出三样东西——正确答案、答案依赖的时间片段,以及画面中具体物体的精确像素级追踪轨迹。换句话说,AI不仅要说"男孩打球伤了那个人",还要指出这件事发生在视频第7.5秒到9.8秒之间,并且用密集的追踪蒙版把男孩和那个人的身体轮廓在每一帧都清晰标出。
这项研究构建了一个名为**ST-Evidence**的基准测试集,是全球首个专门为这类"带证据的视频问答"任务设计的人工核验数据集。与此同时,团队还打造了一个包含16万条训练样本的大规模数据集**ST-Evidence-Instruct**,并在此基础上训练出了性能显著优于现有系统的基线模型。
一、AI看视频为什么会"说瞎话"
在理解这项研究解决了什么问题之前,有必要先理解一个容易被忽视的现象:视频AI的高分答题能力,和它真正"看懂"视频之间,存在着一道巨大的鸿沟。
把视频AI系统的工作方式类比成一个参加闭卷考试的学生会更好理解。这个学生可能读过大量关于"人摔倒"的描述、"球打到人"的场景报道,因此当他看到相关视频时,他能很快给出听起来合理的答案。但如果你追问:"你是在视频哪个画面看到这件事的?"他可能无法指出来,因为他的答案部分来自于背景知识和语言直觉,而不全是来自对当前视频的仔细观察。
这种现象在学术界被称为"语言偏见"——AI系统倾向于根据问题的措辞和训练数据中的统计规律给出答案,而非真正感知视频内容。更麻烦的是,当前主流的大型视频语言模型,无论是OpenAI的o3、谷歌的Gemini 2.5 Pro,还是开源的Qwen3-VL系列,都是以纯文本的方式输出答案,根本无法生成"我是从视频的第几秒到第几秒、画面里的哪个物体上得出这个结论"这样的可验证说明。
有人可能会想:那就让AI生成一些解释性的文字理由不就够了吗?研究团队认为这远远不够。文字解释同样可以是捏造的、模糊的,甚至只是听起来合理的废话。真正能验证AI确实"看见"了什么的,只有像素级别的空间定位——也就是说,AI必须在视频的每一帧中,精确地标出它声称作为证据的那些物体的轮廓。就像法庭上的证人不仅要陈述"凶器是一把刀",还要能在监控录像中指出刀具的具体位置和出现时间。
还有一类情况让稀疏的定位方式(比如只给出矩形边界框)也显得力不从心:视频里的物体会遮挡彼此、发生形变、甚至在移动中交叉换位。比如在一个"三杯猜球"魔术视频中,球被换来换去,仅靠矩形框根本无法追踪某个特定杯子的完整移动轨迹。研究团队因此坚持要求空间证据必须以"密集追踪的像素蒙版"形式呈现——也就是每一帧都精确描绘物体轮廓的图形叠加层,而不是随便画个方框了事。
二、"案发现场还原":E-VQA任务究竟要AI做什么
E-VQA任务的核心逻辑,可以用刑侦调查来理解。一名合格的侦探在结案时,不仅要给出"嫌疑人是X"的结论,还要提交完整的案发时间线和现场物证。E-VQA对AI的要求与此类似:面对一段视频和一个问题,AI必须同时产出三个相互关联的输出。
第一个输出是语义答案,也就是问题的直接回应,比如"男孩打球伤了那个人"。第二个输出是时间证据,即那些对回答问题至关重要的时间段,以起始和终止时间戳的形式给出,比如"第7.5秒到第9.8秒"。这些时间段必须既不能覆盖整段视频(那样没有任何信息量),也不能只是孤立的单帧(那样无法捕捉动态过程)。第三个输出是空间证据,以"密集追踪的时空分割蒙版"呈现。简单来说,就是AI需要在时间证据所覆盖的每一帧画面中,用精确的像素轮廓标出所有与答案相关的关键物体,并且这种标注需要在物体运动、变形、部分遮挡时依然保持连续性和准确性。
这三个输出共同构成一个不可拆分的整体,就像一份完整的案件报告:结论、时间线、物证,缺一不可。当这三者同时存在且相互印证时,我们才能真正确认AI是"看懂了"视频,而非在做语言层面的猜测。
把这个标准与现有的同类研究做个对比就能看出差距。当前一些研究已经尝试让AI指出答案相关的时间段,或者用方框圈出关键物体,但这些工作通常把"定位"当作一个中间步骤,用来提升最终文字答案的准确率。E-VQA则把时间和空间定位提升为最终输出的必要组成部分,而且要求的是密集像素追踪,而非稀疏的关键帧标注。这是一个质的飞跃,就像从"嫌疑人大约在晚上8点出现在案发地附近"到"嫌疑人在晚上8点03分14秒进入现场,摄像头连续追踪记录了其完整移动轨迹"的差别。
三、为E-VQA专门打造的"考场":ST-Evidence基准数据集
在构建评测体系时,研究团队面临的第一个挑战是:全世界几乎不存在同时包含问答、时间定位和密集像素追踪三类标注的数据集。于是,他们从零开始建立了ST-Evidence,一个经过人工核验的高质量基准数据集。
数据集的构建过程分三个阶段,像是一套严格的出版审稿流程。第一阶段是"选题":研究团队从NeXT-QA、Perception Test、STAR、CLEVRER、Ego4D等已有的视频问答数据集中筛选素材,但并非所有题目都能入选。筛选标准包括:视频画质清晰且时长适中(5到200秒之间)、关键时间段不能是整段视频也不能是单一帧、问题必须有具体的视觉答案而非主观判断。他们还借助一个视觉语言模型(Qwen3-VL-235B-A22B)作为初步过滤器。
通过初筛的样本进入第二阶段:"标注"。人工专家拿到视频、问题和正确答案后,需要完成两项任务:找出所有支撑答案的关键时间段,并在以每秒6帧的采样率对每个证据物体进行逐帧的像素级蒙版标注。这个6帧/秒的标准来自著名的视频分割数据集DAVIS,被认为是平衡精细度与标注可行性的合理选择。不够清晰或过于主观的样本在这一阶段会被直接淘汰。
第三阶段是"审稿":由博士级研究人员对所有标注进行独立审核,质量不达标的样本被退回重新标注,确保整个数据集维持严格标准。
考虑到从零开始做密集像素标注极其耗费人力,研究团队还从ViCaS数据集的验证集中引入了补充数据。ViCaS本身已经包含人工标注的密集蒙版和文字描述,研究团队在此基础上让AI生成问答对和干扰选项,再由人工筛除不合格样本、标注时间段,并把正确的空间证据对应到已有的ViCaS蒙版上。
最终,ST-Evidence包含两个评测变体,分别面向不同类型的AI系统。其中**ST-Evidence-Gen**是"开放生成"模式:AI拿到视频和问题,必须自己产出完整的三元组——答案、时间段、空间蒙版。答案准确率用常规正确率衡量,时间证据质量通过"时间交并比(tIoU)"和"预测覆盖率(IoP)"两个指标评估,空间证据质量则使用视频分割领域标准的"J&F"指标,综合考量区域相似度和轮廓精度。ST-Evidence-Gen共收录2706个问题,来自2548段视频。
而**ST-Evidence-MCQ**是"多选题"模式,专门为那些没有内置蒙版生成能力的通用视频AI设计。在这个模式下,答案选择、时间段选择、空间证据选择都以选择题的形式呈现。时间段的干扰选项由Qwen3-VL生成,要求语义相关但与正确答案几乎不重叠。空间证据的干扰选项则由研究人员手工标注,选取视频同一帧中其他合理但错误的物体轮廓,形成四选一的难题。ST-Evidence-MCQ共有1298个问题,来自348段视频,全部源自NeXT-QA数据集。
四、现有AI在"交出证据"这件事上有多糟糕
数据集建好之后,研究团队把当前最先进的视频AI系统全部拉到这个新考场里测了一遍,结果令人清醒。
先看**ST-Evidence-Gen**的结果(见论文表2)。在问答准确率这一项,闭源商业模型表现不错,Gemini-2.5-Pro以83.7%的准确率领先,OpenAI-o3达到82.6%,最强开源模型Qwen3-VL-235B-A22B也有83.6%。这说明这些系统的语言理解能力确实很强。
然而一旦涉及时间定位,画风就变了。即便是最好的Gemini-2.5-Pro,其时间证据的综合得分(t-mean,综合了tIoU和IoP两个指标)也只有49.9,意味着它预测的时间段平均只与正确答案重叠一半左右。大多数开源模型的时间定位能力更差,Qwen2.5-VL系列普遍在20出头徘徊。更值得注意的是,在同一模型家族内部,增大模型参数规模(比如从3B到72B)对时间定位的提升极为有限。但换一代更新的架构(比如从Qwen2.5-VL跳到Qwen3-VL),提升则相当明显——4B参数的Qwen3-VL-4B在时间定位上甚至超过了72B的Qwen2.5-VL。这说明提升的关键不是堆参数,而是架构设计和训练方式,Qwen3-VL引入的"时间戳-帧"交错输入格式可能是其时间感知能力提升的重要原因。
空间证据方面的情况则更为严峻。所有通用视频AI都不具备直接生成视频蒙版的能力,研究团队采用了一种"代理评测"方案:先让通用AI用文字描述证据物体,再把这些文字描述输入专业的分割模型UniPixel-3B,由后者生成蒙版,最后与人工标注的正确蒙版对比打分。即便在这种"借力"的前提下,最强的Gemini-2.5-Pro也只得到44.0的J&F分数,OpenAI-o3得41.9,大多数开源模型在29到42之间。这些数字意味着AI描述的证据物体,和人工标注的真实证据物体之间,存在相当大的偏差。
研究团队还做了一个很有说服力的控制实验:他们手工编写了100个样本的精确物体描述,用同一个UniPixel-3B去生成蒙版,得到44.7的J&F分数,比最好的AI自动描述(Gemini-2.5-Pro的25.6)高出将近20分。这个对比非常清楚地说明:分割模型本身不是瓶颈,真正的问题在于通用视频AI无法准确识别并描述出正确的证据物体。
再看**ST-Evidence-MCQ**的结果(见论文表3)。在选择题模式下,大多数通用模型的答案准确率集中在68%到83%之间,这与常规视频问答的水平相当。但在时间段选择上,各模型的表现开始出现明显分化:Gemini-2.5-Flash以78.81%领先,Qwen3-VL-30B-A3B达到71.54%,而Qwen2.5-VL-7B只有27.12%,接近随机猜测。
空间证据的选择题得分才是最触目惊心的部分。随机猜测在四选一问题下的基准线是25%,而多数开源模型的得分落在23%到27%之间,与随机瞎猜毫无差别。换句话说,这些AI完全无法从四张候选蒙版图像中挑出正确的证据区域——哪怕只是在图片上选一个。唯有Qwen3-VL系列和Qwen2.5-VL-72B表现出明显好于随机猜测的结果,Qwen3-VL-235B-A22B的空间证据准确率达到了86.90%,OpenAI-o3也有84.32%,但这两者在时间定位上的表现却差了很多(分别是70.96%和50.67%)。这进一步印证了一个核心结论:问答能力强,不等于定位能力强;两者的表现几乎没有相关性。
两个专门设计用来"生成"和"定位"的专业模型——Sa2VA和UniPixel——在面对需要复杂推理的E-VQA任务时也显得力不从心。Sa2VA的时间定位分数是0(它根本没被训练来预测时间段),UniPixel虽然能输出时间段,但分数极低(3B版本只有6.5的t-mean),空间定位方面勉强超过通用模型,但也没有明显优势。
五、训练数据不够用怎么办:自动化打造16万条"带证据的题目"
现有数据集既支撑不了E-VQA的评测,更训练不了一个真正能做这件事的模型。研究团队面临的挑战是:大规模、从零开始的人工标注根本不现实,单单是给一段视频做密集蒙版标注就需要大量时间。于是他们设计了两套全自动化的数据生成流水线,通过"废物利用"来解决这个问题。
两套流水线的出发点不同,像是两条交汇的轨道。
第一条轨道叫做"从定位到语义"(Grounding-to-Semantics),专门处理那些已经有密集蒙版标注但缺乏问答对的视频。ViCaS数据集就属于这种情况,它的每段视频都配有人工撰写的文字描述和对应物体的像素级标注。研究团队的策略是:先用AI生成问答对,再把对应物体的现成蒙版"嫁接"过来当作空间证据。
具体操作如下:首先,用Qwen3-VL和Gemini-2.5-Pro两个模型分别根据视频和文字描述独立生成问题、答案、干扰选项、涉及的证据物体,以及一个1到5分的置信度自评和简短解释。每段视频各自生成三到四个候选问题,两个模型加起来通常能给出六到八个候选。然后进行两轮过滤:先自动丢弃格式错误或置信度低于3分的条目,再用Gemini-2.5-Pro做纯文字层面的二次审核。通过审核的样本再次查询Qwen3-VL,让它在以每秒4帧(高于生成问题时的2帧,以便捕捉更细腻的时间动态)的速度浏览视频后预测时间证据。最后,空间证据直接从ViCaS的现有蒙版中提取,对应到被识别为证据物体的那些标注。
第二条轨道叫做"从语义到定位"(Semantics-to-Grounding),处理那些有丰富问答对但没有任何定位标注的视频。这种情况要复杂得多,因为从复杂问题出发,找到对应的空间证据,对AI来说是个很有挑战性的跨模态任务。研究团队把它分解成三步来处理。
第一步是"物证认定":用Qwen3-VL-235B-A22B去分析视频和问题,让它列出能够回答这个问题的关键物体描述(比如"穿红色上衣的人的手")和这些物体清晰可见的时间戳。关键在于,AI还必须同时给出一个基于这些物体的答案,如果答案与正确答案匹配,物证才被接受。如果不匹配,允许最多重试五次;五次后还不对,整个样本被丢弃。这一机制确保了被选出的证据物体确实与正确答案有逻辑关联。
第二步是"坐标确认":拿着已验证的物体描述和时间戳,提取对应帧,让Qwen3-VL在该帧上预测出物体的边界框。为了确保后续追踪的质量,会过滤掉面积过小(小于画面的1%)或过大(超过90%)、宽高比异常,或与相邻帧位置严重不一致的边界框。
第三步是"全程追踪":把通过验证的边界框作为提示,输入SAM-3(Segment Anything Model 3,一个强大的通用分割模型),让它在整段视频中密集地追踪和分割这些物体,生成完整的像素蒙版轨迹。最后还会把重叠度过高(IoU大于0.9)的重复蒙版合并,避免冗余。
两条流水线合并处理后,产出了**ST-Evidence-Instruct**,一个包含16万条带有完整三元组(问题+答案+时间证据+空间证据)的训练数据集,视频来源跨越Perception Test、STAR、CLEVRER和ViCaS,共计约3万段视频。
六、真正训练出"会提供证据的AI":基线模型与实验验证
有了训练数据,研究团队在UniPixel模型的基础上训练了两个规模的基线模型(3B和7B参数),验证整套方案的有效性。UniPixel本身是一个将大型视觉语言模型(Qwen2.5-VL)与分割解码器(SAM-2.1)集成在一起的架构,天然具备同时处理文字推理和像素级分割的能力。
在ST-Evidence-Instruct上做微调时,研究团队没有丢弃UniPixel原来的训练数据,而是混入现有视频分割数据集和通用视频理解数据集,防止模型过度偏向E-VQA任务而失去通用能力。参数更新上采用了LoRA(一种低参数量高效微调方法),只在视觉编码器和语言模型上做轻量调整,而分割解码器则完整训练。训练目标是同时最小化答案和时间段预测的文字生成损失,以及蒙版生成的分割损失。
结果相当令人鼓舞(见论文表2最后两行)。与出发点相同的UniPixel基线相比,微调后的3B模型在时间证据的t-mean上从6.5提升到26.9,提升了20.4分;7B模型从1.9提升到29.1,提升了27.2分。空间证据方面,3B模型的J&F从42.7提升到52.7,提升10分;7B模型从40.3提升到54.1,提升13.8分。
提升的幅度在数字上看起来或许不像天壤之别,但要知道,这是在大幅缩小的答案准确率损失下(3B仅下降0.2,7B反而提升1.0)取得的。更值得注意的是,训练后的3B模型在时间定位上超过了参数量是其二十多倍的Qwen2.5-VL-72B(26.9 vs 25.3),而两个版本在空间定位上则超越了所有其他基线,包括专业的闭源商业系统。
研究团队还在其他视频分割和通用理解基准(MeViS、Ref-DAVIS17、ReVOS、MVBench)上测试了这两个模型,确认它们不仅在E-VQA任务上有所提升,在通用分割和语义理解任务上也持平甚至超过了原始UniPixel基线(见论文表4)。7B版本在四个基准测试中均达到同规模模型的最优或接近最优水平。
自动化标注流水线本身的质量也得到了单独验证:把流水线直接生成的蒙版与ST-Evidence-Gen的人工标注做对比,流水线的J&F得分为62.8,明显高于基线模型(54.1)和最强的235B商业模型(41.9)。这表明流水线生成的训练数据质量是可靠的,有能力作为上限目标引导模型学习。
七、证据真的有用吗:一场"遮脸实验"给出了答案
研究团队还设计了一个颇为直觉化的实验,来验证他们人工标注的证据蒙版是否真的"有用",而不只是恰好出现在画面显著位置的无关区域。
实验选取了ST-Evidence-Gen的200个样本,对每个样本做三种不同处理后分别让Gemini-2.5-Flash和Qwen3-VL-8B回答问题:第一种是正常视频原样播放,第二种是把人工标注的证据物体区域打上马赛克(像素化处理使其完全不可辨认),第三种是把随机选取的非证据区域打上面积相同的马赛克。
如果证据标注是真实有意义的,那么"遮盖证据区域"应该导致回答准确率大幅下降,而"遮盖非证据区域"应该影响不大。
结果与预期完全吻合(见论文表5):Gemini-2.5-Flash在原始视频上准确率为81.32%,遮盖证据区域后急剧下降到61.12%,降幅超过20个百分点;遮盖非证据区域后则只下降到76.43%,降幅不到5个百分点。Qwen3-VL-8B同样呈现出几乎完全相同的模式(79.31% → 58.32% → 73.66%)。两个AI不约而同地在证据被遮盖时"不知所措",在非证据被遮盖时几乎没有受到影响。这有力地说明了人工标注的证据区域确实捕捉到了回答问题所必须的视觉信息,而不是研究者主观认定的"显著区域"。
说到底,这项研究做的事情,是在AI视频理解领域建立了一套"举证责任"机制。过去,AI可以靠语言直觉答题而不被追究;现在,E-VQA要求它必须同时提交时间证据和像素证据,而且这些证据必须经得起量化指标的审核。
从测试结果来看,当前所有主流视频AI系统在这套机制下都暴露出明显短板——不是答错了,而是答不出"我为什么这么答"。参数量的扩大并不能直接弥补这一差距,架构设计和专项训练数据才是更关键的因素。研究团队用16万条自动生成的三元组训练数据,让一个7B的小模型在空间和时间定位上双双超越了所有对手,包括百倍体量的商业系统,这说明数据配方的改变可以带来质变。
归根结底,这项研究揭示的不只是技术缺口,更是一个值得深思的问题:当AI越来越多地进入医疗、驾驶、工业这些高风险场合,仅仅"答对了"是不够的。我们需要能够追责、能够核验的AI推理过程。E-VQA框架和ST-Evidence数据集为这个方向提供了一个可操作的起点。有兴趣深入研究这个方向的读者,可以通过论文编号arXiv:2607.11862查阅完整内容,研究团队的代码和数据也已在GitHub上公开(搜索SalesforceAIResearch/EVQA)。
Q&A
Q1:E-VQA和普通的视频问答有什么区别?
A:普通视频问答只需要AI给出文字答案,E-VQA(证据支撑的视频问答)要求AI同时给出三样东西:文字答案、答案对应的视频时间段,以及支撑答案的画面物体的像素级追踪轮廓。这相当于要求AI不只"说出结论",还要"出示证据",让答案的形成过程可以被验证。
Q2:ST-Evidence数据集为什么要人工标注,不能全自动生成吗?
A:密集的像素级蒙版标注目前只能靠人工才能达到真正高质量,尤其是在物体遮挡、变形等复杂情况下。研究团队的评测基准ST-Evidence采用了人工标注加博士级审核的严格流程,以确保评测结果的可靠性。而用于训练的ST-Evidence-Instruct则通过自动化流水线生成,经验证其质量(J&F得分62.8)甚至超过了微调后的模型和最强商业模型,证明自动化在训练数据层面是可行的。
Q3:为什么增大模型参数规模无法解决视频证据定位的问题?
A:实验结果显示,同一代模型内部从小到大扩参数,时间和空间定位能力几乎没有提升;但换成新一代架构(比如Qwen3-VL相比Qwen2.5-VL),即使参数更小也能大幅超越。这说明定位能力的瓶颈在于架构设计和训练数据的质量,而不是参数量。比如Qwen3-VL引入了时间戳与视频帧交错输入的机制,让模型对视频时间轴有了更细致的感知,这才是性能跃升的真正原因。
热门跟贴