你有没有想过这样一个问题:如果给AI一张纸币的照片,让它生成一段"把纸币折成乌龟"的视频,AI最容易犯的错误是什么?
不是折得不像乌龟。而是它可能直接生成一只真的乌龟。
这听起来有点荒谬,但这恰恰是当下视频生成模型最容易踩的坑。它完成了"乌龟"这个结果,却抛弃了"纸币"这个前提。任务看似达成了,但它跟你给的那张照片,已经没有任何关系了。
这就是中国科学技术大学联合FrameX.AI等机构的研究者们,在一篇名为《SemComp-Bench》的论文里想要揪出来的问题。他们发现,现在评价AI生成视频好不好,大家关注的都是画面清不清晰、动作连不连贯、这个物体像不像那个物体,却很少有人问一个更根本的问题:这段视频,到底有没有完成任务?完成任务的同时,有没有骗一下你的眼睛,用一个毫不相干的东西替换掉你给它的参考对象?
一个被所有人忽略的评价维度
先说说这件事到底难在哪儿。
过去几年,视频生成模型突飞猛进,Sora、Veo、Kling这些名字你可能都听过,它们生成的视频已经能做到画面精致、运动流畅、甚至能理解复杂的文字指令。学术圈用来评价这些模型的工具也越来越成熟,比如VBench、EvalCrafter这类基准测试,它们衡量的是画面质量、时间上的连贯性、指令有没有被听懂。
但这些基准测试有一个共同的盲点。
它们几乎都在测试"过程",却没有真正测试"结果"。换句话说,如果你让AI生成"给这个人化个万圣节骷髅妆"的视频,现有的评价体系可能会关注这个人的脸有没有变形、化妆的手法动作是否流畅,但很少有人真正去核验:视频最后那一帧,这个人脸上到底有没有出现骷髅妆?如果化妆化到一半突然换了个完全不认识的人的脸,这算不算完成任务?
**这正是论文提出的核心概念:语义任务完成型视频生成(Semantic Task Completion Video Generation)。**
它要求生成的视频同时满足两件事:结果真的达成了,并且这个结果和你提供的参考图片之间,保持着"语义层面"上说得通的关系。
> 语义任务完成:一种以结果为导向的视频生成任务范式,强调最终状态是否达成目标,以及这个最终状态是否和参考图片存在合理的高层语义对应关系,而不要求过程完整或者画面像素级一致。
这里有个细节值得琢磨:论文特别强调,评价只看"结果",不要求"完整的中间过程"。这意味着如果你让AI生成"把生鸡蛋煎成煎蛋"的视频,你不需要它把打蛋、倒油、翻面这些步骤都拍出来,哪怕直接给你一个已经煎好的蛋,只要这个蛋在语义上能对应上你最初那颗生鸡蛋(比如蛋壳花纹之类的细节其实是可以忽略的,但"这确实是鸡蛋变成的煎蛋"这个逻辑必须成立),那就算通过。
这个设定听起来有点反直觉。我们平时评价一段"教程类"视频,总觉得步骤越完整越好。但研究者的思路恰恰相反,他们认为:**过程不重要,重要的是这个视频有没有骗你**。它给你看了一个折纸乌龟,这只乌龟到底是从你那张纸币变出来的,还是它偷懒直接找了张乌龟的照片糊弄过去。
想象一下你去工厂验收一批定制家具。你不需要盯着工人从头到尾锯木头、上漆、组装的每一个动作,你只需要打开最后送来的成品,检查一下:这真的是我下单的那种木材做的桌子吗,还是他们随便找了个类似的桌子糊弄我。如果厂家换了材料却告诉你"反正看起来差不多",这批货是不合格的,即便中间的生产流程录像看起来无比专业流畅。视频生成模型现在最大的问题,就是很多时候它给你交了一张"看起来差不多"的成品,却悄悄换了材料。
造一套能验真假的数据集:SemComp-Data
要检验AI是不是在"偷梁换柱",首先得有一套靠谱的测试题。研究者们没有选择自己编造任务场景,而是走了一条更聪明的路:从真实世界的视频里"抠"出天然配对的题目。
他们的原始素材来自一个叫Koala-36M的大规模视频数据集,里面有海量的真实生活视频。
> Koala-36M:一个大规模的真实场景视频数据集,收录了大量涵盖不同主题的完整视频内容,常用于视频生成和视频理解相关研究的数据来源。
研究者的思路是这样的:既然现实中已经有大量记录"从A变成B"的完整过程的视频(比如某人拍了个完整的钩织毛线帽子的教程),那为什么不直接从这些真实视频里,截取"起点画面"和"结果片段",把它们打包成一个天然真实、任务一定可行的测试题呢?
这么做的好处显而易见。如果任务是人工编出来的,你很难保证这个任务真的能实现,万一"把石头变成金子"这种根本不可能完成的任务混进了测试集,那测试结果就毫无意义。但如果这个任务本来就是真人拍出来完成的,那至少能证明:这事儿是能干成的,而且干成之后长什么样,是有真实参照的。
为了把这些原始视频加工成标准化的测试题,团队设计了一条四阶段的处理流水线。
第一阶段叫候选筛选。团队先用标题里的关键词(比如"访谈""新闻""幕后花絮"这些词)把那些高度依赖旁白解说、无法单靠画面判断内容的视频筛掉,因为这类视频没办法只靠"看"来验证任务有没有完成。剩下的视频会被抽帧拼成一张"缩略概览图",交给一个视觉语言模型分类,归到六个大领域里去,比如"手工与精细制作""美妆时尚""美食烹饪""园艺宠物""艺术与精密工艺""运动健身"。
> 视觉语言模型(VLM):一类能同时理解图像和文字的人工智能模型,可以看懂图片内容并用自然语言描述、回答关于图片的问题,论文中用它来做视频内容的自动化分类和质量判断。
第二阶段是状态挖掘。团队先针对每个具体任务类别(比如"组装耳机""美容工具清洁"),人工定义好什么样的画面算是"起点状态",什么样的画面算是"完成状态"。接着让VLM在完整视频里定位出符合这两种状态定义的时间点,抽出对应的画面。为了防止VLM找错,还设计了一道"质检"程序:把两张没有标注的候选帧混在一起,再让VLM单独判断哪张是"完成态",如果它猜错了,说明这两帧的对应关系本身就存在歧义,这组数据直接被扔掉。
第三阶段是视频延展。有了确定的"结果时刻"之后,系统会围绕这个时刻,截取一小段视频片段,让它有大约3到4秒的时长,既能看清楚"结果状态",又不会拖进太多无关内容。
第四阶段是指令结构化,团队让VLM为每个样本生成两版指令:一版是简短版(不超过30个单词,遵循"动词+参考图主体+介词+结果状态"这样的固定模板),一版是详细版(包含背景、光线、颜色、形状等更细的信息)。
这一步之所以重要,是因为研究者在预实验里发现一个有趣的现象。如果直接让VLM看着两张图(起点和结果)随便写指令,它经常会写出一堆没用的细节,比如提到画面里出现的品牌logo、屏幕上的文字水印之类的"噪音信息",这些跟任务本身没什么关系,却会干扰后续的评价。所以他们特意约束VLM,只提炼出任务的核心动作关系。
除了写指令,这一步还要做一件很关键的事:判断"哪些属性必须保留,哪些可以随意改变"。因为不同类型的任务,需要保留的重点是不一样的。
> 对齐类型(Alignment Type):论文定义的四种语义关联方式,分别是物体元素(关注物体种类、材质、数量等)、人物身份(关注同一个人的脸和身体特征要保持一致)、物体外观(关注某个特定物体实例的具体样貌,比如颜色花纹)、场景(关注空间布局和背景关系)。
举个例子来说明为什么要区分这四种类型。如果任务是"给同一个人化个万圣节妆",那这个人的脸和身份必须保持一致,不能化完妆之后变成另一个人,这属于"人物身份"这一类;但如果任务是"把设计图纸变成实际盖好的房子",这时候你要盯着的重点是空间布局和结构对不对得上,而不是要求砖头的具体颜色纹理跟图纸上画的一模一样,这属于"场景"这一类。
如果你不区分这些类型,笼统地要求所有画面元素都一比一还原参考图,会出什么问题?很多任务会被误判为失败。比如"把生鸡蛋煎成煎蛋"这个任务,生鸡蛋是圆的、亮晶晶的,煎蛋是扁的、颜色发白发黄,形状彻底变了,但这变化本身就是任务要求的一部分。如果强行要求外观一致,那所有"状态转变类"的任务全都无法通过测试,这套评价体系也就失去了意义。
最终,团队从大约2万个原始视频里,处理出了1273条这样的标准化测试样本,并进一步挑出了一个包含60条样本、六大领域各占10条的小规模均衡子集,叫做SemComp-Core,用作后续实验的主战场。
SemComp-Bench:把裁判的标准写清楚
有了测试题,还得有靠谱的判卷人。这篇论文选择继续用视觉语言模型来当裁判,但他们没有简单粗暴地让VLM打个分数,而是设计了一整套结构化的"是非题",逼着裁判把判断依据说清楚。
整套评价体系拆成了两个维度:结果达成度(Outcome Achievement,简称OA)和生成可靠性(Generation Reliability,简称GR)。
先说结果达成度。它包含四道判断题。
第一道题叫结果实现,问的是:视频里到底有没有出现指令要求的那个结果,哪怕只是粗粒度的、大概对上就行,先不管细节像不像参考图。
第二道题叫语义关联,问的是:这个已经实现的结果,跟参考图片、跟指令里说的具体要求,对不对得上号,包括物体种类、外观、材质、结构、数量这些细节。
第三道题叫关键实体一致性,它检查视频从头到尾,那些任务相关的关键物体或人物,有没有莫名其妙地消失、被替换,或者悄悄换了材质、外观、身份。
第四道题叫全局视觉连贯性,它检查整段视频有没有出现那种像PPT翻页一样、场景突然整体切换的诡异情况。
这四道题必须全部通过,才能给这条样本记一分。这是个"一票否决"的严格标准,哪怕前两道都答对了,只要人物脑袋突然换了个人,或者画面莫名其妙从室内跳到了室外,这条样本照样算失败。
为什么要设计成这种"一票否决"的严苛模式,而不是每道题单独打分求个平均值?
设想你在验收一份合同翻译。你可能会说"这份翻译大意上翻对了、用词也很准确",但如果这份合同里有一整段莫名其妙缺失或者张冠李戴地插入了别的内容,你还会说这是一份合格的翻译吗?显然不会。任何一个环节出问题,整份文件的可信度都会崩掉。视频生成同理,哪怕前三项都做得漂亮,只要画面里出现一次角色偷换,这段视频的"完成度"就应该被判定为不及格,因为它已经不能被信任了。
再来看生成可靠性,这个维度关注的完全是另一件事:不管任务有没有完成,画面本身是不是"物理上说得通"、"看起来干净"。它有五道题:物理合理性(有没有明显违反物理常识的画面,比如东西悬空飘着)、视觉清晰度(画面是否模糊、曝光是否异常)、无伪影渲染(有没有出现莫名其妙的噪点、色块、空白区域)、场内时空连贯性(同一场景内有没有闪烁、局部变形、瞬间重影)、文字与界面完整性(画面里出现的文字、图标是否清晰可辨)。
这五道题都是"失败导向"型的,也就是说,只有当VLM回答"否"(即没有发现这个问题),这道题才算通过。
这套体系设计得很巧妙的一点在于,它把"任务有没有完成"和"画面质量好不好"这两件事彻底拆开来评价。你可以想象一个学生考试,一份卷子既要考"答案对不对",也要单独考"字写得工整不工整",两者互不干扰,但都要单独给分。这样才能诊断出模型到底是哪个环节出了问题:是压根没理解任务要求,还是理解对了但画面渲染出了岔子。
七个模型上考场,最高分只有37.8%
理论说完了,该看真实成绩单了。研究者拿这套评价体系测试了七个具有代表性的视频生成模型,包括字节跳动的Seedance 2.0、阿里的Wan2.2系列(TI2V-5B和I2V-A14B两个版本)、CogVideoX1.5、SkyReels-V2、腾讯的HunyuanVideo-1.5,以及Phantom-1.3B。
每次评价,团队都会让VLM独立进行三次判断(在不同时间调用三次),取平均值,以此减少单次判断的随机波动带来的误差。
先看结果达成度的成绩单。
| 模型 | 结果实现率 | 语义关联率 | 实体一致性率 | 视觉连贯性率 | 综合OA分 |
| Seedance 2.0 | 0.839 | **0.744** | 0.444 | 0.594 | 20.0% |
| Wan2.2-TI2V-5B | 0.589 | 0.400 | **0.689** | **0.922** | 23.3% |
| Wan2.2-I2V-A14B | 0.800 | 0.528 | 0.628 | 0.789 | 28.3% |
| CogVideoX1.5-5B-I2V | 0.550 | 0.389 | 0.506 | 0.744 | 14.4% |
| SkyReels-V2-I2V-14B | 0.733 | 0.489 | 0.522 | 0.772 | 22.8% |
| HunyuanVideo-1.5-720P | **0.878** | 0.706 | 0.583 | 0.794 | **37.8%** |
| Phantom-1.3B | 0.539 | 0.356 | 0.322 | 0.511 | 3.9% |
这张表最扎眼的数字是最后一列。表现最好的HunyuanVideo-1.5,综合达标率也只有37.8%,也就是说,即便是当下最强的模型之一,十条任务里也只有不到四条能做到"结果真的实现了、跟参考图对得上、过程中没有实体乱跑、画面没有突然切场景"这四件事同时成立。
**这个数字意味着,当前的视频生成模型在"语义任务完成"这件事上,及格率不到四成。**
更有意思的是模型之间的"性格差异"。Seedance 2.0在"结果实现"和"语义关联"这两项上表现很强,单看这两个数字它几乎是全场最佳,但因为"实体一致性"和"视觉连贯性"这两项拖了后腿,综合分反而只排在中游。反过来,Wan2.2-TI2V-5B在"实体一致性"和"视觉连贯性"两项上是全场最高,但它在"结果实现"和"语义关联"上表现平庸,综合分同样不出彩。
这说明了一件事:目前没有哪个模型能同时把"完成任务"和"不出岔子"这两件事都做到位。有的模型敢想敢做,任务完成度高但过程容易翻车;有的模型比较保守稳妥,画面稳定不出错,但压根没往正确的方向努力。这就像考试里,有人擅长解难题但计算总是出错,有人计算特别仔细但只会做简单题,两种人都拿不了高分,只有两方面都强的人才能真正拿到高分,而目前还没有哪个模型做到这一点。
再看生成可靠性的成绩单。
| 模型 | 物理合理 | 视觉清晰 | 无伪影 | 场内连贯 | 文字完整 | GR分 |
| Seedance 2.0 | 0.883 | **0.994** | **0.994** | **0.739** | **0.978** | **91.8%** |
| Wan2.2-TI2V-5B | 0.794 | 0.978 | 0.889 | 0.722 | 0.889 | 85.4% |
| Wan2.2-I2V-A14B | **0.911** | 0.972 | 0.967 | 0.672 | 0.928 | 89.0% |
| CogVideoX1.5-5B-I2V | **0.944** | 0.811 | 0.772 | 0.583 | 0.828 | 78.8% |
| SkyReels-V2-I2V-14B | 0.778 | 0.922 | 0.739 | 0.328 | 0.789 | 71.1% |
| HunyuanVideo-1.5-720P | 0.800 | 0.939 | 0.883 | 0.472 | 0.861 | 79.1% |
| Phantom-1.3B | 0.778 | 0.972 | 0.856 | 0.506 | 0.728 | 76.8% |
Seedance 2.0在这里彻底翻身,拿到全场最高的91.8%。有意思的是,它在"结果达成度"排名倒数第二(20.0%),却在"生成可靠性"上排名第一。这说明它更擅长把画面拍得漂亮、稳定、干净,却相对不太擅长真正把任务给完成好。这两个榜单几乎完全对不上号,恰好证明了论文最开始想说的那个观点:画面好看和任务做对,是两件不能混为一谈的事。
还有一个共性问题浮出水面:所有模型在"场内时空连贯性"这一项上的得分普遍偏低,最低只有0.328,最高也只有0.739。这说明当下的视频生成模型有一个共同的短板:单帧画面可以拍得很精美,但让画面在一个连续场景里稳定地演变下去,却是个更难的活儿。这也侧面解释了为什么很多AI生成视频,截个图看着很惊艳,连起来播放却总觉得哪里"怪怪的"。
文生视频还是图生视频,差距有多大
论文还专门做了一组对照实验,拿三个模型家族(Wan2.2、CogVideoX1.5、HunyuanVideo-1.5)分别测试了图生视频(I2V,基于参考图片+文字指令生成)和纯文生视频(T2V,只靠文字指令生成)两种模式的差异。
| 模型 | 模式 | 指令类型 | 结果实现 | 语义关联 | 实体一致 | 视觉连贯 | OA分 |
| Wan2.2-A14B | I2V | 详细 | 0.800 | 0.528 | 0.628 | 0.789 | **28.3%** |
| Wan2.2-A14B | T2V | 详细 | 0.889 | 0.522 | 0.317 | 0.117 | 4.4% |
| Wan2.2-A14B | T2V | 简短 | 0.389 | 0.111 | 0.806 | 0.250 | 0.6% |
| HunyuanVideo-1.5 | I2V | 详细 | 0.878 | 0.706 | 0.583 | 0.794 | **37.8%** |
| HunyuanVideo-1.5 | T2V | 详细 | 0.833 | 0.606 | 0.389 | 0.133 | 4.4% |
| HunyuanVideo-1.5 | T2V | 简短 | 0.550 | 0.100 | 0.761 | 0.178 | 1.7% |
这组数据说明了一个非常朴素但重要的道理:给AI一张参考图片,和只给它一段文字描述,效果天差地别。
以HunyuanVideo-1.5为例,同样是"详细指令",图生视频模式的综合分是37.8%,纯文生视频模式直接跌到4.4%,差了将近九倍。这个差距主要不是来自"任务有没有实现"(这一项两种模式其实差不多),而是来自"语义关联度""实体一致性""视觉连贯性"这三项的全面崩盘,尤其是视觉连贯性,从0.794骤降到0.133。
这个现象其实很好理解。你给AI一张具体的参考图片,相当于给了它一个明确的"锚点",它可以时时刻刻拿这张图对照着生成后续画面,就像画家对着照片写实作画。但如果你只给一段文字,AI只能凭着对文字的理解自己"想象"出一个物体,全靠脑内构建,没有一个稳定的视觉参照物贴着走,画面很容易越走越飘,最后跟最初设想的样子渐行渐远。
这就好比让两个人分别复述一件东西的样子。一个人手里拿着照片照着描述,另一个人只是听了一句话描述就凭记忆去转述给第三个人。第一个人复述出来的准确度显然会高得多,因为他随时可以核对参照物,而第二个人全靠脑子里那个模糊的印象,传几次话之后早就走形了。如果AI完全脱离参考图片,它就成了那个"只靠记忆转述"的人,越往后画面越容易失控。
还有一个更细腻的发现:在纯文生视频模式下,详细指令的表现总是好于简短指令,主要靠"结果实现"和"语义关联"这两项撑起来;但简短指令反而在"实体一致性"和"视觉连贯性"上得分更高。
这里面藏着一个耐人寻味的权衡关系。详细指令信息量大,能把想要的结果说得更清楚,但同时也给AI出了一道更难的综合题,它得同时兼顾更多要求,协调难度陡增,容易在执行过程中翻车。简短指令因为要求简单,AI生成起来更"从容",画面不容易崩,但正因为要求太模糊,它很可能压根没往正确方向走。这就跟布置任务时的"详细说明书"和"一句话吩咐"类似:说明书写得越细,执行起来越容易漏东西出错;一句话吩咐虽然执行流畅,但很可能理解跑偏,做出来的东西根本不是你想要的。
论文之外,这件事还牵动着什么
这篇论文并没有孤立地出现。它站在了一整条研究脉络上。
在视频生成基准测试这个方向上,此前的VBench和后续的VBench++、VBench-2.0已经建立起一套相对成熟的画面质量评价体系,覆盖视觉保真度、时间连贯性等维度。也有研究开始关注物理合理性和常识约束问题,比如探讨视频生成模型是否符合基本物理规律的一系列工作。这些工作共同构成了当下视频生成评价体系的基础,但它们始终没有正面回答"任务到底完成了没有"这个问题,这正是SemComp-Bench想要填补的空白。
在模型能力这条线上,从早期的CogVideoX、HunyuanVideo,到后来的Wan2.2、Seedance 2.0,模型的生成质量在过去两年里确实进步飞快,从画面精细度到指令遵循能力都有明显提升。但这篇论文用一套新的检验标尺告诉我们,画面越来越漂亮,不代表任务真的越做越准。这提示未来的模型改进方向,可能需要专门针对"结果导向的语义一致性"去做优化,而不只是继续堆叠画质和分辨率。
写在后面
读完这篇论文,我印象最深的不是那些百分比数字,而是那道"折纸乌龟"的例子背后藏着的逻辑陷阱。
一个AI模型完全可以在"看起来完成了任务"这件事上表现得极其自信,同时在"这真的是你要的那个东西吗"这件事上悄悄作弊。这种作弊甚至不需要模型有意识地"骗人",它可能只是因为生成一只普通乌龟比生成一只由特定纸币折叠出的乌龟容易得多,于是它选择了那条阻力最小的路。
这让我想到一个更大的问题:随着AI生成内容越来越多地进入创作、教学、演示这些实用场景,"看起来对"和"真的对"之间的距离,可能会成为一个长期被低估的风险点。如果一段AI生成的产品演示视频,把参考商品的关键特征悄悄替换掉了,观众很可能根本察觉不出来,因为整段视频看起来天衣无缝。
那个37.8%的数字,或许比它字面意思更值得警惕。它不是说AI做得还不够好,而是说,我们现在还没有足够好的方法去发现它到底做得好不好。
Q&A
Q1:SemComp-Bench是什么?
A:SemComp-Bench是一套评价视频生成模型的基准测试体系,它不只关注画面质量,更关注AI生成的视频是否真正完成了指令要求的任务,同时是否与参考图片保持了语义层面的对应关系,而不是偷偷用一个不相关的画面替代。
Q2:为什么现有的视频生成模型评价体系不够用?
A:因为现有基准测试主要衡量画面清晰度、时间连贯性和指令遵循程度,却很少验证生成结果是否真正达成了任务目标,也很少检查生成的结果是否与参考图片存在合理的语义关联,容易漏掉"任务看似完成但实际偏离参考对象"的情况。
Q3:测试结果显示AI视频生成模型表现如何?
A:七个代表性模型中,表现最好的HunyuanVideo-1.5综合达标率只有37.8%,说明当前模型在同时做到"完成任务、语义对得上、实体不乱跑、画面不突变"这四件事上普遍不及格,图生视频模式明显优于纯文字生成模式。
热门跟贴