来源:市场资讯
(来源:科技行者)
你玩过密室逃脱吗?
有一种题目是这样的:给你一堆散落的线索卡片,让你推理谁是谁的兄弟姐妹。如果只用文字复述所有线索,"甲是乙的姐姐,丙是丁的哥哥,乙又是丙的邻居",你脑子里很快就会乱成一团麻。但如果你随手在纸上画个家谱图,箭头一连,谁跟谁什么关系立刻一目了然。
这不是错觉。人类大脑处理空间关系和处理语言逻辑,走的根本不是一条通路。而现在最火的AI推理模型,不管是能一步步"想"问题的大语言模型,还是能看图说话的多模态模型,骨子里干的事情都是一样的:把所有问题都翻译成一串文字,然后一步步往下写。
这就带来一个很实际的问题。
**当问题本身是空间的、结构的、关系性的时候,硬逼着AI用文字去描述,是不是在做一件很别扭的事?**
加州大学伯克利分校的一组研究者决定认真测试这件事。他们的答案藏在一个叫CoVA-SFT的新数据集里,而这背后的故事,比你想象的要曲折。
当推理链遇到棋盘
先说说现在AI推理的主流玩法。
思维链
:Chain-of-Thought,简称CoT,指的是让AI在给出最终答案前,先像人一样一步步写出中间推理过程,而不是直接蹦出结果。
这套打法在数学证明、代码生成这类任务上效果拔群,OpenAI的o1模型、DeepSeek-R1都是靠这个吃到了红利。原因很简单:数学证明本身就是用语言符号写出来的,让AI用语言去推导语言,是同一种材料加工同一种材料,不别扭。
但换个场景就不一样了。
设想你在下棋。国际象棋的每一步局面,人类高手看一眼棋盘就能读出大概的态势:哪块子力密集、哪条线路被封锁、王翼是否暴露。但如果把这盘棋换成文字记录,也就是那种"e2e4 e7e5 g1f3"的代数记谱法,你要在脑子里一步步重建整个棋盘的样子,这个过程比直接看棋盘费劲得多。
论文里也拿这个举了例子:对人类来说,看一张真实的棋盘图,远比读一长串代数记谱容易理解局势。可现在的AI推理链,恰恰是反过来的,它把所有视觉性质的问题都压缩成了那种别扭的记谱法式文字。
那有没有人尝试解决这个问题?有,而且不止一家。
Visual Sketchpad
让AI在推理时自己画草图,当作视觉版的思维链来用。
Mirage和CoVT
:这两个方法走的是另一条路,用连续的隐藏视觉表示(不是真的图片,而是一串数字向量)替代部分文字推理,这些向量和输入图片里的视觉特征对齐。
Zebra-CoT
:一个提供了大量"图文交替"推理数据的数据集,教AI在推理时穿插使用真实图片。
这些工作都很有意思,但它们有一个共同的前提:题目本身自带图片。你输入的问题里已经有一张图了,AI只是在这张已有的图基础上继续观察、继续画。
伯克利团队盯上的是另一个更棘手的场景:如果题目一开始压根没有图,是纯文字描述的逻辑题、排班题、家族关系题,AI能不能自己凭空画出一个视觉工作台,然后在这个自己画出来的工作台上继续推理?
这就是CoVA-SFT要教会AI的本事,从零开始构建视觉抽象,而不是观察已有的图。
51904条轨迹,222046张图,五大门派
先说规模。
CoVA-SFT
:全称Chain of Visual Abstractions,包含51904条训练样本,涵盖超过222046个多模态推理步骤,横跨17个具体任务,被归为5个大的"视觉抽象家族"。
这五大家族分别是:表格类(比如排班约束问题)、图论类(比如家族关系、图着色)、布局类(比如空间迷宫、装箱问题)、游戏类(象棋、数独、迷宫、ARC智力题)、数学类(几何证明、组合数学)。
这个分类本身就很有意思,因为它对应的是人类在现实中真实会用到的四种视觉外化工具:解约束问题时你会画表格,理清亲属关系时你会画家谱树,处理关系推理时你会画关系图,做空间推理时你会画符号示意图,证几何题时你会画辅助线。
数据是怎么造出来的?团队没有让人工一条条标注(那样成本太高也太慢),而是设计了一条三阶段的"智能体式"自动生成流水线,让Claude 4.5 Sonnet这个大模型自己扮演生成器的角色。
第一阶段叫"理由与问答构造"。AI要先说清楚,为什么这道题需要画一个视觉工作台,工作台上该画什么,然后自己生成配套的问答对。
第二阶段是"智能体式渲染"。AI一步步生成推理轨迹,同时调用Matplotlib这样的画图工具,把每一步的视觉工作台真的画出来,画完的图片再喂回给AI,作为它继续往下推理的上下文。
第三阶段是"验证与自我纠错"。AI要检查自己刚画出来的图和题目描述是否吻合,如果发现结构性错误(比如家谱图里画错了一条亲属关系边),就重新进入渲染循环,把图重画一遍。
这个三阶段循环让我想起小时候写作文,老师总说"写完要自己读一遍再检查"。多数人图省事跳过这一步,直接交卷了事。而CoVA-SFT这套流水线的价值恰恰在于,它逼着AI必须做这道"回头检查"的功课。如果跳过验证阶段会怎样?后面实验结果里会看到答案,那些跳过验证直接靠外部工具渲染的方法,错误会在推理链条里一路传导下去,越滚越大,最后彻底跑偏。
数据集里还专门配了一个测试集,叫CoVA-Bench,包含1700条留出样本(每个任务100条),专门用来检验模型有没有真的学会长链条的逻辑推理和视觉状态维护,而不是死记硬背训练集里的套路。
训练一个真的会"画图想问题"的模型
数据有了,接下来要验证这套数据到底有没有用。
团队选择在Qwen3-VL-8B-Thinking这个开源多模态模型上做微调,让它适应这种"图文交替"的推理格式。这意味着模型不仅要输出最终的文字答案,还要在推理过程中产出中间的潜在视觉轨迹,用来支撑整个推理过程。
这里有个技术细节值得展开说说。
每张交替出现的图片,被编码成固定预算的128个视觉token。训练时用的是一个双重目标损失函数:文字部分走标准的交叉熵损失,视觉部分则用余弦相似度损失,让模型预测出的视觉token向量,尽可能对齐真实的目标向量方向。两部分损失加权相加,构成总的训练目标。
余弦相似度损失
:一种衡量两个向量方向是否一致的损失函数,只关心向量的夹角,不关心向量的长度,常用于对齐两个高维表示。
这套设计背后的逻辑是,让模型不仅学会说什么,还要学会在推理过程中如何维持一个连贯演化的、有内部一致性的视觉状态。这就好比学开车,教练不只是让你记住"红灯停绿灯行"这句口诀(对应文字损失),还要让你的手脚肌肉真正形成条件反射(对应视觉token的对齐损失)。如果只死记口诀而不练手感,遇到实际路况照样手忙脚乱。
训练用了8张NVIDIA H200 GPU,用FSDP2做分布式训练,混合精度用bfloat16,训练了2个epoch,一共只用了51.9K条样本。这个规模在如今动辄百万级训练数据的时代里,算是相当克制的。
结果揭晓:赢了对手,却输给了自己人
实验对比分为两大阵营。
第一阵营是纯文字推理派,包括三个基线:Qwen3-Think(纯语言模型)、Qwen3-VL-Instruct和Qwen3-VL-Thinking(多模态模型但只用文字模式跑)。
第二阵营是交替式视觉推理派,包括CodePlot-CoT、Thinking with Generated Images(简称TwGI)、MathCanvas、Zebra-CoT。这些方法的共同特点是,它们都靠外部工具调用来生成或渲染视觉素材,再把结果喂回推理链。
结果表格如下(按五大任务类别的平均准确率排列):
| 方法类型 | 具体方法 | Table | Layout | Graph | Game | Math | 平均 |
| 纯文字 | Qwen3-Think | 67.3 | 69.3 | 44.5 | 19.3 | 25.0 | 45.1 |
| 纯文字 | Qwen3-VL-Instruct | 61.0 | 71.0 | 57.0 | 15.0 | 26.0 | 46.0 |
| 纯文字 | Qwen3-VL-Thinking | 80.3 | 76.3 | 46.5 | 25.5 | 27.3 | 51.2 |
| 交替视觉 | CodePlot-CoT | 15.3 | 17.3 | 20.2 | 2.0 | 9.7 | 12.9 |
| 交替视觉 | TwGI | 2.0 | 0.0 | 1.0 | 0.0 | 1.3 | 0.9 |
| 交替视觉 | MathCanvas | 14.0 | 22.0 | 35.3 | 0.5 | 12.3 | 16.8 |
| 交替视觉 | Zebra-CoT | 9.3 | 13.8 | 26.5 | 0.5 | 5.7 | 11.2 |
| 潜在token | **CoVA-SFT(本文)** | 47.2 | 53.4 | **62.0** | 20.0 | 8.5 | 38.2 |
第一个值得停下来看的地方是,CoVA-SFT在所有"交替视觉推理"这个阵营里表现最好,平均分38.2%,比第二名MathCanvas的16.8%高出一倍还多。这说明什么?说明同样是想让AI"画图辅助推理",把视觉工作台内化到模型自身的隐藏表示里,比依赖外部工具调用渲染图片这条路子,靠谱得多。
为什么外部渲染的方法表现这么差,有的甚至接近0分?团队给出的解释是,一旦外部渲染过程出了错,比如MathCanvas调用绘图工具画错了一根线,这个错误就会直接污染后续所有的推理步骤,而且几乎没有回头修正的机会。TwGI的问题更严重,它生成的中间图片本身经常是语无伦次的,图像内容和推理逻辑对不上,长链条推理下来基本就是噪音在传递噪音。
这里可以做个具体的类比。想象你在装修房子,找了一个包工头帮你贴瓷砖,贴歪了一块,但这个包工头不会回头检查,直接往下贴。等你发现问题的时候,已经贴了半面墙了,全部要敲掉重来。这就是外部渲染方法的困境:错误一旦产生,缺乏内部反馈闭环去及时纠正,只能任由它传导扩散。而CoVA-SFT把绘图这件事变成了模型自身内部状态演化的一部分,出错的概率天然更低,即便出错也更容易在下一步被自我修正机制捕捉到。
但真正让人意外的地方在后面。
拿CoVA-SFT去跟纯文字推理的三个基线比,结果并不是全面碾压。在Table任务上,CoVA-SFT的47.2%明显落后于Qwen3-VL-Thinking的80.3%;在Layout任务上,53.4%对76.3%,差距也不小;在Math任务上更夸张,只有8.5%,而纯文字模型能跑到27.3%,几乎是三倍的差距。
唯独在Graph(图论关系推理)这个类别上,CoVA-SFT的62.0%反超了所有纯文字模型(最好的纯文字方法只有57.0%)。
这个反差就是整篇论文最有嚼头的地方。
为什么偏偏是图论任务上视觉推理占优?团队的解释是,图这种数据结构,节点、边、可达性,本质上是一种天生适合用视觉呈现、却很难用大段文字维持的信息。你想想前面提到的家谱推理题,如果纯用文字推理,AI每往前推一步,就得把已知的所有亲属关系在脑子里重新念叨一遍,稍不留神就漏掉一条边或者搞混一层辈分。而画一张关系图,把边和节点摆在那里,视觉上一眼扫过去,关系链条清清楚楚,不需要每次都重新枚举。
反过来,为什么数学任务上视觉推理反而更差?这里有一个很值得琢磨的解释:数学推理本身早就有一套非常成熟的符号系统去表达(就是我们熟悉的代数式、方程),大语言模型对这套符号语言已经练得炉火纯青了。这时候你再让它去学一套额外的、连续的视觉潜在token表示,相当于让一个已经能说流利英语的人,非要绕道先翻译成另一种它不熟悉的手语,再翻译回来。这不是在帮它,是在给它添麻烦,多此一举反而拖了后腿。
这也回应了论文标题里"Chain of Visual Abstractions"这个说法背后真正想传达的东西:视觉化推理不是万能钥匙,它只在特定类型的问题上才是真正的助力,用错了地方反而是累赘。
这件事没那么简单:论文自己承认的局限
值得肯定的是,这篇论文没有把自己包装成一个完美的解决方案,作者们在Limitations一节里坦诚列出了好几个尚未解决的问题。
第一个问题,数据质量的天花板取决于上游生成模型。整个CoVA-SFT数据集是由Claude 4.5 Sonnet充当"老师"自动生成的,虽然设计了验证与自我纠错循环,但这个循环能抓住的只是结构性的、明显的错误。那些藏在文字推理或渲染代码里的细微幻觉,很可能悄悄溜进了训练数据里,被直接蒸馏进了下游模型,进而给最终微调出来的模型的准确率上限设了一道隐形的天花板。
第二个问题,视觉抽象的种类被渲染工具的能力所限定。目前所有的视觉工作台都是静态的、结构化的形式,二维表格、拓扑图、布局网格、几何坐标图。这些视觉抽象是符号化的、示意图式的,还谈不上连续的、深度感知层面的视觉理解,更别提开放世界里那种复杂的空间模拟或者连续的机器人交互环境了。
第三个问题,训练成本的显著增加。同时优化文字token和连续视觉token这件事,比纯文字的监督微调要费更多的计算资源。双目标损失函数需要精细的超参数调节,还需要更大的显存带宽。而且论文里提到,一些复杂任务需要8个甚至更多的连续视觉状态,这意味着推理阶段需要更长的上下文窗口和更多的计算预算,才能在长链条推理里动态维护这个工作台。
坦白说,这些局限性并不让人意外,甚至可以说是这类研究注定要面对的代价。任何一次尝试把新的表示方式塞进现有模型架构的工作,早期版本大概率都要经历这种"能跑但还不够好"的阶段。
站在更长的时间线上看
这篇论文不是横空出世的孤例,它站在一整条研究脉络的延长线上。
往前追溯,Whiteboard-of-Thought这类工作,教AI用生成执行代码画出图表当作外部草稿纸;Visual Sketchpad让AI边推理边画草图;Zebra-CoT提供了图文交替推理的数据资源,但前提是题目本身已经带图。
这些工作共同指向一个方向:让AI的推理过程不再局限于纯文字这一种介质。CoVA-SFT往前迈的这一步,是把这个思路扩展到纯文字输入的场景,让AI学会无中生有地构建视觉工作台,而不只是观察已有的图像。
再往后看,这个思路的延伸空间还很大。论文里提到的latent-token方法,比如Mirage和CoVT,用连续视觉表示替代部分文字推理链,这条路径本身也还在快速演化中。团队在论文结论里也留下一句意味深长的话:学习连续的潜在视觉表示,可能比生成离散的视觉token,是统一多模态模型里更有效的一种归纳偏置。这句话本身,很可能会成为后续研究者继续深挖的方向。
写在后面
读完这篇论文,最让我意外的不是CoVA-SFT赢了多少个交替推理基线,而是它在数学任务上输给纯文字模型的那个数字:8.5%对27.3%。
这个反差告诉我们一件挺重要的事:给AI装上"画图能力"这件事,不是放之四海而皆准的升级,它更像是一把双刃剑,用对地方是神器,用错地方是累赘。这打破了我原本的一个默认预期,我以为既然视觉推理是个热门方向,那给模型加上视觉抽象能力应该是全面利好,结果论文用扎实的数字告诉我事情没这么简单。
另一个值得单独拎出来说的细节是,图论任务成了唯一一个视觉推理碾压纯文字推理的领域,而且团队给出的解释相当有说服力:图结构天生是视觉的,语言去描述图结构是别扭的。这提醒我一件更普遍的事情:不同类型的知识和结构,天然适配不同的表示方式,逼着所有问题都用同一种模态去解决,本身就是一种效率损耗。这个道理其实早就该被意识到,只是很少有人用这么干净的实验数据把它摆在你面前。
如果视觉抽象只在关系型、结构型任务上有优势,那是不是意味着未来真正的解法,是让模型自己学会判断"这道题该不该画图",而不是一刀切地给所有问题都套上视觉推理的外壳?这个问题,论文没有回答,但已经埋下了线索。
Q&A
Q1:CoVA-SFT数据集是什么?
A:CoVA-SFT是加州大学伯克利分校团队推出的大规模数据集,包含51904条训练样本和超过22万个多模态推理步骤,涵盖17个任务,专门用来教AI模型在解决纯文字推理问题时,学会自己构建并维护内部的视觉工作台,而不是把一切都翻译成文字。
Q2:CoVA-SFT训练出的模型效果怎么样?
A:在交替视觉推理这类方法里,CoVA-SFT训练出的模型表现最好,平均分38.2%,是第二名的两倍多。但和纯文字推理模型相比,它在数学任务上明显落后,只有在图论关系推理任务上反超了纯文字模型。
Q3:为什么AI在数学题上用视觉推理反而变差?
A:因为数学推理早就有一套成熟的符号系统(代数式、方程)供AI使用,AI对这套语言已经很熟练了,这时候再让它多学一套连续的视觉表示反而是额外负担,属于多此一举,实验数据显示准确率从27.3%掉到了8.5%。
热门跟贴