打开网易新闻 查看精彩图片

这项由南京大学、北京大学、清华大学、新加坡国立大学、香港科技大学(广州校区)以及快手旗下Kling团队联合开展的研究,于2026年7月15日以预印本形式发布在arXiv平台,编号为arXiv:2607.14189v1,研究方向归属于计算机视觉(cs.CV)领域。有兴趣深入了解的读者可通过该编号在arXiv网站检索完整论文。

假设你是一位电影导演,正在筹备一段广告短片。你给了助理三样东西:一张男主角的照片、一张女主角的照片,还有一双你希望他们穿的限量款球鞋的图片。然后你说:"帮我拍一段他们在沙漠公路边的二人世界,两个人都开口说话,鞋子的特写要清楚,背景音得有沙漠的风声。"

这个要求听起来不难,对人类摄影师来说只是日常工作。但对今天的AI视频生成系统来说,这件事比表面看起来复杂得多。它不仅要同时"记住"三张参考图各自的样子,还要搞清楚哪张图是人、哪张图是物品、人物该说什么、声音该从哪里来、鞋子该出现在谁的脚上——任何一个环节出错,整段视频就会显得荒唐可笑。

更关键的是,现有的评测体系根本没法准确衡量AI在这类任务上到底表现得好不好。正是为了填补这个空白,来自上述多所顶尖高校和企业的研究团队,构建了一套名为MultiRef-Compass的全新评测基准,专门用来诊断和衡量AI在"多参考图转音频视频生成"这一复杂任务上的真实能力。

一、为什么"多张参考图"会让AI这么头疼

先来理解一下这个问题的本质。当你给AI一张图,让它生成一段视频,这个任务虽然不简单,但AI至少只需要专注于一件事:让视频里的主角和那张图里的形象保持一致。这就像让一个演员模仿一位名人的样子表演,只需要记住一个人的特征就够了。

但当你给了AI三张图,情况就完全不一样了。AI首先得弄清楚这三张图之间的关系。假设你给了同一个人从三个不同角度拍的照片——正面、侧面、背面——AI需要意识到"这其实是同一个人,不是三个不同的人",然后把这三张照片里的信息综合起来,在视频中生成一个前后一致的单一人物形象。这个问题叫做"身份分裂":如果AI不够聪明,它可能会把三个视角的图理解成三个不同的角色,视频里就突然出现了莫名其妙的三个人。

而当三张图分别代表不同的事物时,又出现了新的挑战。比如男主角、女主角、球鞋,这三者都是独立的个体,AI需要把每个参考图准确地"绑定"到视频中对应的角色和物品上,不能把鞋子穿到女主角脚上,不能把男主角的声线给女主角,不能把台词说反了。这类错误叫做"属性漏出"或者"绑定错误"。

还有第三个更微妙的问题:就算AI认出了每个参考图里的样子,它在生成视频时也可能偷懒——直接把参考图粘贴进去,就像把一张照片剪下来贴到另一张画上。这种视频看起来就像是劣质的合成拼图,人物和背景之间没有自然的光影过渡,显得格格不入。这个问题叫做"复制粘贴伪影"。

理解了这三层挑战,就能明白为什么研究团队觉得现有的评测工具不够用。那些已有的评测基准,要么只测试用文字描述生成视频的效果,要么只给一张参考图看保不保真,要么只管视频画面不管音频——没有一个系统能把多张参考图、多模态生成、音视频联动这些要求同时考察清楚。

二、MultiRef-Compass是如何设计出来的

构建这套评测基准,研究团队做的第一件事是搭建一个可以复用的素材库,就像厨师在开始烹饪之前先把食材分门别类地整理好。

素材库分成几大类。人物素材包主要来自于两个途径:一是从已有的免版权视频里截取不同角度的帧图,二是用AI图像生成工具,从一张主图出发生成三到六张不同视角、不同表情、不同姿势的辅助图。无论哪种途径,都经过人工逐一核查,确保同一个包里的图片确实是同一个人,且面容清晰、质量过关。物品素材包涵盖了生活中常见的各类物件,从衣服配饰到食物玩具,应有尽有。场景素材包则收录了城市、自然、室内等多种环境背景。此外还有视频素材包和音频素材包,为更高难度的测试提供动态参考和声音参考。

整理好素材之后,研究团队把这些素材按照不同的组合方式,搭建出三个核心测试板块,外加一个进阶挑战板块。

第一个板块专门考察"同一个人、多个角度"的情况。测试材料是同一个人物的多张不同视角图片,生成系统需要把这些图理解成同一个人,并在视频中呈现出自然、连贯的形象。一旦系统误判,视频里就会出现莫名其妙的分身现象。

第二个板块考察异质性组合,即把人物、物品、场景的图片混搭在一起。系统要理解每张图各自的角色,把它们正确地放置到对应的位置——人物出现在对应的角色位置,物品被正确使用,场景成为恰当的环境背景,而不是让这些元素互相混淆。

第三个板块是最复杂的:多个人物同时出现,每个人都来自不同的参考图,他们之间还有互动和对话。系统不仅要认出每个人,还要准确分配各自的动作、台词和声音来源。

第四个进阶板块在前三个基础上,增加了视频和音频作为参考输入,测试系统能否同时参考动态影像和声音样本来生成内容。

每一组素材的组合都会配上一段文字提示,这段文字不是随便写的,而是通过结构化的方式生成的,分别描述了视觉要求、音频要求、对话内容和时间顺序,最后整合成一段完整的生成指令。提示的平均长度约为600个汉字,大约一篇短博文的篇幅。生成之后还经过人工审核,剔除不合理或有潜在安全风险的内容。

整个数据集共包含350个测试样本,其中300个分布在三个核心板块,50个属于进阶挑战板块。七成样本使用真实人物和场景,三成使用卡通风格。六成样本要求生成音效或环境音,三成要求背景音乐,七成要求人物开口说话,四成有服装外观方面的约束,三成要求多镜头结构。

三、怎么给生成结果打分

设计出数据集之后,研究团队面临的下一个挑战是:如何评测这些生成的视频?这件事比听起来难得多。人类一眼就能看出一段视频里人物"看起来不像本人"或者"声音对不上口型",但要让机器以客观、可重复的方式做出同样的判断,需要相当精密的工具。

评测框架被分成四个维度,就像从四个不同方向给一段视频做体检。

第一个维度叫做基础质量,考察的是最基本的视听技术指标,相当于体检里的血压和体重。视觉技术质量用一个名为DOVER++的工具来打分,专门检测画面里有没有明显的低质量问题。音频技术质量用Meta公司的Audiobox工具来评估,检查声音是否清晰、自然、有无明显噪声。解剖质量则关注视频里的人物形体是否合理——手脚比例对不对、关节能不能正常弯曲、人物和背景的融合有没有违和感,这部分由AI语言模型担任评委,依据一份核查清单逐项判断。

第二个维度叫做参考一致性,这是整套评测体系最具创新性的部分。它分成三个子指标:实体保真度、细节保留度和绑定准确度。

实体保真度是用来衡量生成视频里的人物、物品、场景,和参考图里的样子有多像。具体实现方式是这样的:系统会从生成的视频里均匀抽取帧图,然后用目标检测工具(YOLO-World)找到视频帧里的人物和物品区域,截取出来和参考图进行相似度比对。真实人物用人脸识别系统(ElasticFace)加上整体外形比较(SigLIP),卡通人物则用专门的动漫人脸检测器和DINOv2图像特征进行比对。场景的比较直接用全帧图像的整体相似度。

这里有一个聪明的设计值得着重介绍。纯粹的相似度分数有个天然漏洞:如果生成系统直接把参考图"贴"进视频,相似度分数反而会很高,但这样的视频显然是作弊的。为了识别这种作弊行为,研究团队引入了一个叫做"粘贴自然度系数"的修正机制,让AI语言模型判断视频中的人物是否和场景自然融合,还是像剪贴画一样突兀。这个系数会等比例地放大或缩小最终分数:融合自然,系数接近1,分数基本不变;像贴纸一样突兀,系数大幅下降,最终分数随之缩水。

细节保留度关注的是参考图里那些容易被忽略的细节,比如特定的配饰图案、发型、衣服上的扣子或者鞋带。这些细节不一定通过相似度计算能捕捉到,所以用AI语言模型根据一份细化清单来逐项核查。绑定准确度则专门检查有没有出现"张冠李戴"的错误,比如对话台词被分配给了错误的人物,或者动作被执行者和实际角色对不上。

第三个维度叫做音视频一致性,核心问题是:声音和画面配不配得上?这里包含四个子指标。口型同步度检测说话的人的嘴唇动作和声音是否同步,用到了一个叫做LatentSync的专业工具,但在使用前会先经过AI过滤,剔除那些脸部不够清晰稳定、不适合做口型检测的视频,避免误判。事件音效匹配度检查声音和画面里发生的事情是否对应——有人踩在木地板上就应该有木板声,玻璃杯碰撞就应该有叮当声。声源准确度检查声音是否从正确的人物身上发出,特别是在多人对话场景下,不能张口的人发出声音。音色相似度是专门为进阶测试板块设计的,当提供了声音参考样本时,检测生成的语音是否和参考音色接近,用说话人识别模型(ECAPA-TDNN)提取声纹特征后进行余弦相似度计算。

第四个维度叫做指令遵循,考察的是生成系统有没有按照文字提示的要求去做。视觉任务遵循检查场景设置、动作、服装等可见要求是否都满足了。音频任务遵循检查要求的音效和背景音乐有没有生成。台词内容准确度检查人物说出来的话是不是和提示里写的一致,语言对不对。时间顺序遵循检查多个事件或多个镜头的出现顺序有没有按照提示里写的顺序来。

在打分机制上,自动化工具和AI语言模型各司其职。AI语言模型打出的分数使用1到5分的均值意见分制度(MOS),和用户体验评测中常用的评分方式一致,1分代表极差,5分代表优秀。

研究团队还引入了一个叫做"二次审查"的机制,专门用来纠正AI评委自身的不一致问题。由于AI语言模型在独立评测每段视频时,可能对同一个标准理解得宽严不一,二次审查阶段会把同一道评测题目下所有模型的初始评分和理由并排摆出来,横向比较,发现明显的前后矛盾或评判偏差后进行修正。二次审查只修正清晰的判断错误,不改变评测维度,也不重新定义指标,最终目的是提高评分的可靠性和可追溯性。

四、八款AI系统上场比拼,结果如何

研究团队在这套评测基准上测试了八款代表性的AI系统,其中六款是只能通过官方接口或平台使用的商业系统,包括Seedance 2.0、Kling 3.0、HappyHouse 1.1、Gemini-Omni、Wan 2.7和Vidu Q3-Mix;另外两款是开源系统,分别是Wan2.1-VACE和SkyReels-V3。开源系统因为没有原生的音频生成能力,音频相关的指标不参与评分。

在基础质量方面,Gemini-Omni在视觉技术质量上得分最高,HappyHouse 1.1的音频技术质量领先,而Seedance 2.0在解剖质量——也就是人体结构自然程度——上表现最好。不过Seedance 2.0在处理真实人物时偶尔会出现面部区域异常,研究团队推测这与该系统更严格的内容安全过滤机制有关。

参考一致性方面出现了一个有意思的分化现象。Kling 3.0在实体保真度的自动化相似度分数上拿了最高分,说明它生成的视频在视觉外观上与参考图最接近。但Seedance 2.0在绑定准确度和细节保留度上更胜一筹,表明它在"把对的东西放到对的位置"以及"记住参考图里的细节"这两件事上做得更好。这两套指标并不完全一致,说明高相似度分数并不等于真正做到了精准还原参考图的所有要素,二者测量的是参考保真度的不同侧面。

自动化相似度评分和AI语言模型评分之间的差距,在SkyReels-V3的案例中体现得最为典型。这款开源系统被捕捉到了一个经典的"作弊"行为:它直接把参考图粘贴进了生成的视频里,导致相似度分数虚高。但在引入粘贴自然度修正系数之后,它的排名从第五名直接跌到了最后一名。与此同时,这款系统还出现了明显的身份分裂问题——把同一个人物的不同角度图误判为不同的人,视频里因此出现了不该存在的多重身份。Vidu Q3-Mix则因为视觉融合更自然,在修正之后排名反而上升了一位。

音视频一致性方面,Gemini-Omni的口型同步得分最高,但这里有一个需要了解的背景:Gemini-Omni倾向于生成正面、稳定、几乎不动的说话脸,而这类视频恰好对口型检测工具最友好。那些人物头部动作较多、视角变化丰富的系统,虽然视频看起来更生动,却因此在口型同步测试中处于不利位置。这个现象揭示了当前口型检测工具的局限性,未来的评测方法需要更能应对动态人脸的技术。Seedance 2.0在事件音效匹配度上领先,HappyHouse 1.1在声源准确度上得分最高,说明这两项能力并非同一件事——能把音效和画面对上,不代表能把声音准确地归属到正确的说话者。

指令遵循方面,没有哪款系统在所有子项上都占优势。Seedance 2.0在视觉任务方面更强,Kling 3.0在音频任务和台词准确度上更突出,Wan 2.7在时间顺序遵循上表现更好。这说明当前AI系统在指令理解方面呈现出模态专一化的倾向,并不能全面均衡地应对多类型的指令要求。

从整体来看,Seedance 2.0在四个维度的综合排名中位居第一,这得益于它在各个维度上相对均衡的表现,没有特别突出的短板。Gemini-Omni紧随其后,在基础质量和音视频一致性上有明显优势。Kling 3.0和HappyHouse 1.1各有所长,分别在参考一致性和指令遵循上有突出表现。

两款开源系统与商业系统之间的差距明显,在参考一致性和指令遵循这两个维度上落差尤其大。特别是在需要理解多张参考图之间关系并进行准确绑定的任务上,开源系统目前还有较长的路要走。

研究团队还对评测结果进行了人类偏好对齐验证,邀请了四位人工标注员对同一组视频做偏好评比,结果显示多参考指南针的评分与人类偏好之间的皮尔逊相关系数在0.90到0.96之间,表明这套自动化评测系统的判断与人类的直觉判断高度一致。

五、从测试结果里能看到什么规律

除了整体排名,这套评测框架还揭示了一些更细腻的规律,这些规律对理解当前AI视频生成技术的真实水平很有参考价值。

在参考图复杂度和保真度之间的关系上,测试数据显示出清晰的递减规律。第一板块(同一人物多视角)的平均实体保真度最高,达到0.693;第二板块(异质性组合)下降到0.589;第三板块(多人物绑定)进一步降到0.575。下降的主要原因在于人物一致性的难度随着参考图复杂度的提升而急剧增加,物品和场景的保真度在三个板块之间相对稳定,反而是人脸和人体的保真度在复杂场景下受到的冲击最大。

在台词准确度上,研究团队把中英文分开统计,发现了明显的语言差异。英文整体准确率为87.8%,中文为88.0%,两者相当。但在单个系统层面,差异就大了。Kling 3.0中文准确率达到97.6%,英文为90.6%;HappyHouse 1.1中文准确率高达100%,英文稍低;Gemini-Omni则恰好相反,英文准确率高达98.1%,但中文只有76.7%,常见错误包括语义漂移、关键词被替换、或者直接用英文替代了中文。这个结果直观地反映了不同系统的语言优势区间,对用户选择工具有实际参考价值。

在指令遵循的子项拆解上,视觉任务遵循又被细分为行动遵循、穿着遵循、基础场景设置和细节遵循四个子项。商业系统在基础场景设置和细节遵循上表现相对稳定,但在行动遵循和穿着遵循上出现了较大的系统间差距。开源系统在所有子项上都普遍偏低,尤其在行动遵循和穿着遵循上完成度明显不足。这说明视觉任务遵循不应被当作一个单一的能力来衡量,一个系统的高平均分背后可能隐藏着某些具体要求上的严重欠缺。

评测稳定性方面,研究团队从三个核心板块随机抽取了60个样本,把整套依赖AI语言模型的评测流程重复跑了五次,结果显示所有指标的相对标准差都低于1%,逐条目的平均绝对误差也保持在很小的范围内。这意味着测试结果不是偶然的,换一天跑同样的测试,结论大概率不会改变。

说到底,MultiRef-Compass这项研究的核心价值并不在于给某个AI系统颁奖或者排黑榜,而在于它搭建了一个让研究者和开发者能够精准诊断问题所在的工具。就像医院的体检报告不只告诉你"身体不好",而是精确到"左心室射血分数偏低"——MultiRef-Compass不只说"这个AI生成的视频质量差",而是能指出"它的问题在于多人物场景下的身份绑定错误,以及中文台词的完整度不足"。

这对整个领域的发展是有实质意义的。当你知道自己的弱项在哪,才能有针对性地改进。同样,对于那些正在决定采用哪款AI视频生成工具的内容创作者或企业来说,这套评测框架给出的分维度诊断,远比一个综合评分更有参考价值——毕竟,你的工作究竟更需要精准的形象保真度、还是更需要可靠的多角色对话生成,答案因人而异。

归根结底,AI视频生成正在快速进入一个需要"同时记住很多事"的新阶段。单张图、单指令、纯画面的时代已经过去,用户正在期待AI能像真正的助理一样,一边记住多张参考图里每个细节,一边把声音、画面、动作协调成一个浑然一体的作品。MultiRef-Compass告诉我们,现在最好的商业系统已经能在某些方面做到这一点,但没有任何一款系统能在所有方面同时做到,这个领域还有相当大的进步空间。如果你对这个领域感兴趣,不妨思考一个问题:当AI能够完美地处理十张参考图并生成完全一致的长视频时,我们的内容创作方式会发生什么样的变化?完整论文可通过arXiv编号arXiv:2607.14189v1获取。

Q&A

Q1:MultiRef-Compass评测基准和以前的AI视频评测有什么不同?

A:以往的评测基准要么只测试文字转视频的效果,要么只用一张参考图测试外观保真度,要么只关注画面不管声音。MultiRef-Compass是首个同时要求多张参考图输入、覆盖音频和视频生成、还专门检测多角色绑定准确度的综合评测框架,能揭示出之前评测体系完全覆盖不到的AI能力短板。

Q2:AI视频生成为什么容易出现"把参考图直接贴进视频"的问题,这有什么危害?

A:一些AI系统为了让生成结果和参考图相似,会走捷径,直接把参考图的像素信息复制进视频画面,而不是真正理解参考图然后重新生成一个自然的形象。这样的视频画面里人物和背景会有明显的割裂感,像是剪贴画贴在照片上。更大的问题是这会误导评测:相似度分数很高,但视频根本不能用。MultiRef-Compass引入的粘贴自然度修正机制专门识别并惩罚这种行为。

Q3:Gemini-Omni口型同步得分最高,是不是说它生成的说话视频最真实?

A:不完全是。Gemini-Omni倾向于生成脸部正对镜头、几乎不动的说话画面,这类静态正面脸对口型检测工具最友好,得分自然高。但"脸不动"和"视频真实自然"并不是一回事。其他系统生成的人物可能头部有自然晃动、视角有变化,这反而让口型检测工具测不准,导致得分偏低。这个发现本身也说明,当前口型同步评测工具还需要进一步改进,才能公平衡量动态说话人的真实表现。