你有没有过这种经历:正在看一场球赛直播,球员刚刚起跳,你脑子里已经"看到"了他大概会往哪个方向扣篮。你不需要真的在脑海里画出一张未来的画面,你只是"感觉"到了接下来会发生什么。
这种能力,对人类来说毫不费力,但对AI来说,是一道相当棘手的题。
苹果的研究团队最近发了一篇论文,专门琢磨这件事:怎么让多模态大模型(能同时理解文字和图像视频的AI系统)在看一段没播完的视频时,提前"预感"接下来会发生什么,而且还要做到既快又准。这篇论文的名字叫《Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning》,翻译过来大致是"超越视觉思维链:为主动式视频推理内化视觉思考"。
听起来有点绕,我们慢慢拆开讲。
先搞清楚:AI要解决的是个什么问题
先说说这类任务到底是什么。研究者把它叫做"主动式视频推理",具体分成两种情况。
第一种叫早期事件预测
*早期事件预测:在一个动作还没做完的时候,就要认出这是个什么动作。比如一个人刚抬起手准备倒水,视频还没播到"水倒出来"那一刻,AI就得说出"这是倒水"这个答案。*
第二种叫下一事件预测
*下一事件预测:预测接下来即将发生、但目前画面里压根还没出现的动作。比如看到一个人正在拿杯子,AI要猜出他接下来大概率会去倒水,而这个倒水动作在当前画面里根本还没开始。*
这两种任务和我们平常说的"看完一整段视频再回答问题"完全不是一回事。普通的视频问答,证据都摆在那儿了,AI只需要老老实实"看完再说"。但主动式推理不一样,它要求AI在信息不全的情况下,靠已经看到的这一小段,去推断没看到的部分。这就好比让你看一部电影的前十分钟,然后回答"男主角接下来会不会和女主角吵架"——你手里的线索是不完整的,你得靠经验和逻辑去补全。
那现在的AI是怎么处理这类问题的?主流思路是"思维链"
*思维链(Chain-of-Thought,简称CoT):让AI在给出最终答案之前,先生成一系列中间推理步骤,就像人做数学题时先写演算过程再写答案。*
大多数模型用的是"文字版"思维链,也就是模型先在心里(其实是在生成的文本里)嘀咕几句话,分析一下情况,然后再给出答案。这个办法在很多任务上确实管用,但放到视频推理里,问题就露出来了:语言天生不擅长精确描述运动、位置、物体形态这些视觉信息。你让AI用文字描述"球员起跳后手臂会怎么摆动,篮筐的角度大概是多少",这种描述往往又啰嗦又不准,甚至有时候模型会说一堆和真实画面毫无关系的"幻觉"内容。
于是有人想出了另一个办法:既然文字讲不清楚,那就让AI直接"画"出来。这就是所谓的"视觉思维链"
*视觉思维链(Visual CoT):AI在回答问题前,先生成一张或几张representing推理过程的图像(比如画出未来可能发生的场景),然后再基于这些图像给出最终答案。*
这个思路听起来挺聪明,毕竟"一图胜千言"。论文里提到的一个代表性方法叫Zebra-CoT,它的做法是:模型先想象并画出一张"接下来会发生什么"的画面,然后把这张画面重新编码成AI能理解的信息,再据此生成文字答案。这套流程在空间推理、机器人操作规划等任务上确实拿到了不错的成绩。
但问题来了:画一张图,可不是免费的。
画图的代价:慢了5到6倍,还不一定值
研究者做了一个非常扎实的对照实验,专门衡量"画图预判"这件事到底值不值。
他们拿Zebra-CoT这套视觉思维链方案,和一个只做文字回答、不画图的基础模型(叫Answer-Only SFT,即"只用标准答案微调")放在同一起跑线上比较。
*Answer-Only SFT:一种最朴素的训练方式,直接把观察到的视频片段和问题丢给模型,让它输出答案文字,中间不经过任何额外的视觉生成步骤。*
结果很有意思。在早期事件预测任务上,视觉思维链确实带来了提升,四个评价指标全面超过了纯文字方案,其中CIDEr(一种衡量生成文本质量的指标)提升了17.9%。这说明"画一张未来的画面"确实能帮上忙,至少在动作已经开始、只是还没结束的情况下是这样。
可是到了下一事件预测任务,情况就变了。那里要预测的事件压根还没开始,视觉思维链的效果变得可有可无,甚至在三个指标上还出现了轻微下降,只有METEOR指标涨了4.3%。
更要命的是速度。研究者用端到端的实际运行时间来衡量效率,而不是简单数生成了多少个文字token,因为画图这件事牵涉到解码出一张图片、再把图片重新编码成模型能处理的向量,这些开销根本不会体现在"生成了多少字"这种统计里。测出来的结果是,视觉思维链让早期事件预测的平均延迟涨到了原来的6.2倍,下一事件预测涨到了5倍。
这就好比你问朋友"这场比赛谁会赢",他非要先跑去买一份实体报纸、翻到体育版、画一张详细的赛况示意图,再根据这张图告诉你答案。等他画完图,比赛可能已经打完了。如果不这么做,直接凭经验脱口而出,虽然可能少了几分"依据感",但至少能在比赛还没结束时给出预判——而这正是"主动式"任务最看重的东西:时机。
研究者还做了一个特别巧妙的诊断实验:如果给模型的不是它自己画出来的(可能不准确的)未来画面,而是真实发生的未来画面(也就是"作弊"用了正确答案对应的真实帧),结果会怎样?
答案是:所有指标全面暴涨。早期事件预测的ROUGE-L指标涨了21.6%,下一事件预测涨了6.8%。
*ROUGE-L:一种常用于评估自动生成文本质量的指标,衡量生成的答案和标准答案之间在词序上的重合程度。*
这个结果揭示了一个关键的事实:未来的视觉信息本身是有用的,问题不在于"要不要参考未来",而在于AI自己画出来的那张"未来的画"到底靠不靠谱。它画得不准,就等于给自己挖了个坑,反而可能误导后面的判断。研究者管这个叫"取决于生成未来状态的保真度"——翻译过来就是,如果你的想象力不靠谱,靠它来推理反而会拖后腿。
这个发现直接引出了整篇论文的核心问题:未来的视觉信息确实有价值,但把它变成一张真实的图片再重新处理一遍,这个过程又贵又不一定准。有没有办法只要"未来信息的价值",不要"画图和读图"的成本?
核心方案:把"想象"内化到脑子里,而不是画在纸上
苹果团队给出的答案叫Internalized Visual Thinking
*内化视觉思考(Internalized Visual Thinking,简称IVT):一种后训练框架,让模型在训练阶段学习预测未来画面的隐藏表示(不是真实图片,而是一串数字向量),但在实际使用时不再生成任何图像,直接给出文字答案。*
这里最关键的设计思路是:训练的时候让模型"脑补"未来,但推理的时候不要求它把脑补的画面画出来。
具体怎么操作?论文用一个简单的公式说明了这件事。假设模型看到了一段视频的前半部分,还有一个问题要回答。标准的训练方式只会计算一个损失,衡量模型给出的文字答案和标准答案之间的差距。IVT额外加了一项:让模型同时预测未来几帧画面的"潜在表示"
*潜在表示(latent representation):不是一张能直接看的图片,而是经过某个编码器处理后得到的一串抽象数字向量,包含了图像的关键信息,但不是像素本身。*
打个比方:如果画一张完整的图片相当于"把一整段乐曲完整地演奏一遍",那预测潜在表示更像是"心里默唱这段旋律的骨架,记住它的节奏和走向,但不发出声音"。你依然在"想",只是没有把这个想法转成外部可感知的完整作品。而且默唱的过程比真实演奏快得多,也不需要乐器。如果不这么做,非要每次都完整演奏一遍才能继续往下想,那整个思考过程就会被表演本身拖慢。
训练的时候,模型的损失函数由两部分组成:一部分是常规的文字生成损失,另一部分是预测未来潜在表示的损失,两者加权相加(论文里权重设成1)。这样训练完之后,模型的参数里已经"吸收"了大量关于画面如何演变、物体如何转移、动作如何延续的知识。
关键的一步在这里:等到真正要用这个模型回答问题的时候,IVT走的是和"只用标准答案微调"完全一样的推理路径,直接从观察到的视频片段生成文字答案,不再多走一步"预测未来潜在表示"的计算,更不会去解码出一张真实图片。
这就意味着IVT在推理阶段的计算图,和那个最朴素、最快的Answer-Only SFT基本一样。训练时它多想了很多,但用的时候,它一步到位。
预测什么样的"未来画面"最管用
内化的思路定下来了,但具体要往模型脑子里塞什么样的未来表示,这里面还有大量讲究。研究者试了四种不同的目标表示。
第一种叫Flux-VAE潜变量
*Flux-VAE:一种图像生成模型中用来压缩图片信息的编码器,它把图像转换成的潜变量保留了大量细节和空间结构信息,主要是为了后续能把图片准确还原出来。*
第二种是DINOv2特征
*DINOv2:一种自监督视觉特征提取模型,它抓取的是图像里更高层次的语义概念,比如"这是一只猫"这种抽象信息,而不太关心猫的每一根毛发长什么样。*
第三第四种都基于SigLIP2
*SigLIP2:一种视觉-语言联合编码模型,论文里测试了它的两个变体,一个是"自适应"版本,编码器的参数会随着训练一起更新;另一个是"冻结"版本,编码器参数固定不变。*
实验结果显示,预测Flux-VAE潜变量的效果是四种方案里最强、最稳定的,在早期事件和下一事件预测两类任务上全面领先。DINOv2也有提升效果,但幅度和稳定性都比不上Flux-VAE。自适应版本的SigLIP2普遍比冻结版本表现更好。
这个结果背后传递的信息值得琢磨一下:不是随便找个"辅助视觉目标"塞进训练过程就管用,关键要看这个目标表示本身是不是暴露了足够多的、和场景演变有关的结构信息。DINOv2那种偏向语义抽象的特征("这是一只猫")固然有用,但对于"这只猫接下来会往哪边跑""它的爪子会怎么落地"这类细粒度的动态预测,保留了更多空间细节的Flux-VAE明显更对味。
这就好比让一个学生提前预习明天要考的内容。如果只告诉他"明天考的是关于猫的知识"(相当于语义特征),他确实能有点准备,但比起把整份考试大纲的具体条目都给他看一遍(相当于保留细节的表示),后者能让他准备得更精准、更充分。如果预习材料只给一个模糊的主题词,学生大概能猜个方向,但具体到哪道题、考哪个细节,他是抓瞎的。
训练数据怎么配比,是个大问题
确定了预测什么之后,下一个问题是:训练过程中,应该让模型花多少精力去练"预测未来"这件事,又花多少精力去练"回答问题"这件事?
研究者对比了三种数据配比方案:1比1、3比1、5比1,数字越大意味着分配给"回答问题"这个任务的训练样本越多,相应地留给"预测未来"的样本就越少。
结果出乎不少人的预料。那些偏重"回答问题"的配比(3比1和5比1)在训练刚开始的时候表现更好,进步很快。但训练进行到大约12000到18000步之后,这些配比就开始停滞不前,甚至掉头下降。反倒是最均衡的1比1配比,一开始表现落后,但一直在稳步上升,最终在20000步的时候,四个指标全部超过其他两种配比,拿到了整场比赛里最好的成绩。
这个现象说明了什么?说明预测未来这件事,不能被当成一个"偶尔调味"的辅助任务。如果对它的训练强度不够,那个"预测未来"的能力就会在持续的答题训练中被慢慢覆盖、稀释掉,最终对下游推理起不到什么帮助。
这就好比健身,如果你每周只抽10分钟练核心力量,剩下的时间全在跑步,短期内你确实跑得更快了,但核心力量始终没能真正建立起来,跑到后期反而容易受伤、掉速度。只有把核心训练和有氧训练放在同等重要的位置上,长期坚持下来,才能看到综合能力的提升。如果不坚持给核心力量足够的训练量,那这项能力永远只是个摆设,遇到需要它发挥作用的场合就顶不上去。
基于这个发现,研究团队在后续所有实验里都统一采用了1比1的均衡配比。
怎么"教"模型预测未来:两种不同的教法
定好了要预测什么、按什么比例训练,接下来要解决"怎么教"的问题。论文比较了两种预测目标的训练方式。
第一种叫直接特征回归
*直接特征回归:让模型直接预测出目标表示的具体数值,用均方误差衡量预测值和真实值之间的差距,这是最直接、最朴素的监督方式。*
第二种叫矫正流匹配
*矫正流匹配(Rectified-Flow Matching):一种源自扩散模型的训练技巧,不直接预测目标本身,而是让模型学习一个"速度场",也就是从一个随机噪声逐步演化到目标表示所需要走的路径方向。*
实验发现,这两种训练方式谁更好,取决于你预测的是什么类型的目标。对于DINOv2这种语义特征,直接回归的效果明显更好,四个指标全面领先。而对于Flux-VAE潜变量,两种方式的差距就小得多,直接回归在大部分训练阶段领先,但到了训练末期,矫正流匹配在个别指标上反而略微反超。
这里有个挺值得说一说的细节。论文提到,虽然它们用的基础模型BAGEL原本在生成图像的时候用的就是矫正流匹配这套方法,但把这个方法直接搬来预测未来的潜在表示,效果并不总是最优的。直接回归这种更简单的方式,在很多情况下反而表现相当,甚至更好。
这说明一个道理:某个技术在它原本的用途里表现出色,不代表把它挪到一个新场景里依然是最佳选择。真正决定用哪种训练方式的,是目标表示本身的特性,比如它的数值范围、分布形态、维度大小,而不是"这个方法在别的地方好用"这种经验之谈。
训练节奏:一步到位,还是分两步走
接下来,研究者琢磨了另一个问题:预测未来这件事,应该和回答问题这件事同步训练,还是分成两个独立阶段,先专门练预测未来,再专门练回答问题?
他们对比了三种做法。第一种是只练回答问题的基础方案。第二种叫两阶段训练,先花10000步专门练"预测未来",然后完全切换到只练"回答问题"的模式,继续训练。第三种是联合训练,让两个目标从头到尾同步进行。
结果非常清楚:联合训练在所有指标上都拿到了最好的成绩,比基础方案的ROUGE-L提升了12.6%,CIDEr提升了26.3%。而两阶段训练反而比什么都不做(基础方案)还要差,所有指标全面下滑,ROUGE-L掉了6.5%。
这个结果相当反直觉。你可能会觉得,先打好"预测未来"的基础,再去专攻"回答问题",听起来是个很合理的学习顺序,就像先学走路再学跑步。但实验数据推翻了这个直觉:一旦进入第二阶段的"专攻"训练,模型好像把第一阶段辛苦学到的东西给忘掉了大半,最后甚至比完全没学过还差。
这其实揭示了一个很朴素但容易被忽视的道理:如果两种能力要互相配合发挥作用,那么训练它们的过程也得是配合进行的,不能指望先各自练好再拼装到一起。就像学一门乐器合奏,如果吉他手和鼓手分别关起门来单练一个月,最后拼到一起,配合度往往还不如从第一天就一起排练来得好。分开练习各自都能精进技术,但两者之间的呼应关系,只有在同步训练里才会真正建立起来。如果不这样同步训练,那"预测未来"学到的东西,很可能就是一堆和"回答问题"这个最终目标脱节的知识,派不上用场。
模型内部结构:共享脑子,还是分开思考
最后一个关键设计选择,是关于模型内部的架构安排。研究者比较了两种结构。
第一种叫Dense设计
*Dense(密集)架构:模型处理"理解型"信息和"预测型"信息时,用的是完全同一套解码器参数,两种任务的训练信号会直接一起更新这套共享参数。*
第二种叫MoE设计
*MoE(Mixture-of-Experts,混合专家)架构:模型内部准备了两套不同的前馈网络参数,理解类信息交给"理解专家"处理,预测未来的信息交给"预测专家"处理,两者只在其余部分共享计算资源,专家的选择是按信息类型直接指定的,不是靠一个学出来的路由器动态决定。*
研究者还测试了不同的"预测视野"
*预测视野(Prediction Horizon):模型需要往未来预测多少帧画面。比如预测视野等于1,就是只预测未来1秒后的画面;等于3,就是要同时预测未来1秒、2秒、3秒这三个时间点的画面。*
结果显示,两种架构在所有预测视野下都比基础方案表现更好,但各有各的脾气。在预测视野较短的情况下(只预测未来1到2秒的画面),共享参数的Dense架构明显更胜一筹,比如在预测视野为2的时候,Dense拿到37.4的ROUGE-L,而MoE只有33.8。但随着预测视野拉长,Dense的表现开始走下坡路,而MoE反而表现得更平稳,大约在预测视野为3的时候达到自己的最佳状态,而且视野从3拉到4变化也不大。
这个规律说明,当你要预测的未来足够"近"、足够确定的时候,让预测任务和回答任务共用一套大脑,信号传递得更直接,效果更好。但一旦要预测得更远,未来的不确定性变大,把预测任务和回答任务绑得太紧,反而可能把一些不那么靠谱的信号硬灌进语言生成的通路里,拖累最终表现。这时候把两条通路适当隔开,反而能减少这种"噪音干扰"。
这就好比一个团队里,如果任务目标非常明确、时间紧迫(比如"下一秒该做什么"),让所有人共用一份信息、协同决策效率最高。但如果要规划的是一个相对模糊、跨度更长的目标(比如"接下来几天团队方向如何调整"),让专门的人负责专门的模块,反而能减少互相干扰,各自把自己那块想清楚。如果不做这个区分,硬要一套人马应对所有时间跨度的决策,短期任务或许还行,长期规划很容易变得混乱。
真正的成绩单:六个测试场景全面告捷
把前面所有的设计决策敲定之后,研究团队在三个大规模数据集上做了完整测试:Ego-Exo4D、Ego4D、EPIC-KITCHENS-100
*Ego-Exo4D、Ego4D、EPIC-KITCHENS-100:三个大规模第一人称视角视频数据集,记录了大量日常活动,比如做饭、修东西、运动等,常被用来研究人类行为理解和预测。*
每个数据集都测试了早期事件预测和下一事件预测两类任务,总共构成六个评测场景。
对比的对象包括几个开源视频大模型作为参照基准,比如LLaVA-NeXT-Video、VideoLLaMA3、Qwen2.5-VL、Qwen3-VL,再加上论文自己搭建的几个受控对比方案:只用标准答案训练的基础方案、文字思维链方案、视觉思维链方案,以及IVT本身。
最终结果是,IVT在全部六个测试场景里,每一个场景的每一个指标,都超过了只用文字训练的基础方案。这是一个相当干净、没有例外的胜利。
跟视觉思维链比,情况稍微复杂一点。IVT在六个场景里的四个场景中表现更好,而且在全部三个下一事件预测的场景里都获胜了。视觉思维链只在两个早期事件预测场景上略胜一筹,分别在Ego4D和EPIC-KITCHENS-100上超出IVT约1.2到1.3个ROUGE-L点。
放在下一事件预测这个更难的任务上看,差距相当明显。IVT在三个数据集上的平均ROUGE-L是49.7,而视觉思维链只有45.9,差了将近4个点。这符合前面观察1里提到的那个规律:视觉思维链在"未来事件根本还没开始"的情况下,画出来的那张想象图很难真正靠谱,反而是内化在模型参数里的预判能力更管用。
跟外部的通用大模型比,IVT在7B这个参数规模量级上具备了竞争力,不过还是稍稍落后于规模更大的Qwen3-VL-8B。这也提示我们,IVT这套方法本身并没有让模型变得"无限强大",它解决的是效率和准确度之间的权衡问题,不是凭空创造出超越模型规模天花板的能力。
速度方面的对比更是直观。IVT的推理路径和最朴素的基础方案几乎一致,平均延迟维持在1.2秒左右,而视觉思维链平均要花6.5秒以上,慢了超过5倍。在极端情况下(P95延迟,也就是最慢的5%的样本),视觉思维链甚至要花将近8秒,IVT只要不到2秒。
对于那些真正需要"在事情发生前给出预判"的场景来说,这个速度差距不是锦上添花,而是决定这套系统能不能真正落地的门槛。想象一下自动驾驶系统需要判断"前方行人接下来是否会突然横穿马路",如果这个判断要花6秒才能算出来,那这套系统压根没有实用价值,行人可能早就走过去了或者出事了。
换个场景考验一下:没见过的数据集,行不行
到这里,研究团队还留了一手,专门测试了一下"举一反三"的能力。他们把Charades这个数据集完全排除在训练数据之外,直接拿在Ego-Exo4D上训练好的模型去测试。
*Charades:一个记录人们在室内进行各种日常活动的视频数据集,常用于动作识别和理解任务。*
这个测试相当苛刻,因为Charades和训练用的Ego-Exo4D在画面内容和任务形式上都有明显差异,Ego-Exo4D是开放式的文字描述任务,而Charades要求从多个选项里选出正确答案。这意味着模型不仅要面对全新的视觉场景,还要在完全没见过的答题格式上保持不出错。
结果是,IVT依然拿到了在所有受控对比方案里最好的成绩,准确率达到73.2%,超过了基础方案的71.7%和视觉思维链的58.2%(视觉思维链在这个跨域测试里掉得特别惨)。而且这个优势在不同的预测视野设置下都保持稳定。
这个结果给了一个额外的信心:IVT训练出来的那种"预判未来"的能力,不是死记硬背某个数据集里的具体场景规律,而是真的学到了一些更通用的、关于视觉动态变化的知识,换个陌生场景依然能派上用场。
写在后面
读完这篇论文,最触动我的一点是那个"用真实未来帧替代生成帧"的诊断实验。研究者没有满足于"视觉思维链效果一般"这个表面结论,而是硬生生把答案先泄露给模型,看看模型到底能不能用好这份"作弊"信息。结果发现能,而且用得很好。这说明视觉思维链的失败不是"未来信息没用"这个假设的失败,而是"生成未来信息的能力不够"这个具体环节的失败。这种拆解问题的方式,值得在做任何"为什么方法A不如方法B"的分析时借鉴,别急着否定整个思路,先看看是不是某个具体齿轮卡住了。
另一个让我意外的地方是两阶段训练的失败。直觉上"先打基础再精修"是很多人做事的默认策略,但这篇论文用扎实的数字告诉你,至少在这个场景下,分阶段训练比完全不做预测训练还差。这多少提醒我们,某些看似合理的"分步走"策略,在特定任务结构下可能反而是有害的,值得多留一分警惕,别把直觉当成必然正确的经验。
论文里没有细谈的一个问题是,如果预测视野继续拉长到几十秒甚至几分钟,这套内化预判的思路还能不能撑住?毕竟越往远处预测,不确定性会指数级增长,那时候模型内部藏着的这份"预感",到底还剩多少含金量,这个问题留给了未来的研究者。
Q&A
Q1:Internalized Visual Thinking(IVT)是什么?
A:IVT是苹果团队提出的一种后训练框架,让多模态大模型在训练阶段学习预测未来视频帧的潜在表示,但在实际推理时不需要真正生成图像,直接输出文字答案,从而兼顾预判能力和响应速度。
Q2:IVT和视觉思维链(Visual CoT)相比有什么优势?
A:IVT在六个测试场景中全面超过纯文字训练方案,并在四个场景中优于视觉思维链,尤其在下一事件预测任务上表现更好,同时推理速度比视觉思维链快5倍以上,避免了生成和重新编码图片带来的延迟。
Q3:为什么视觉思维链在预测还没发生的事件时效果不好?
A:因为视觉思维链需要模型自己"画出"未来画面,如果画得不准确,反而会误导后续判断。实验显示,用真实的未来帧替代模型生成的帧后,效果大幅提升,说明问题出在生成质量上,不是未来信息本身没有价值。
热门跟贴