想象一下你在批改一份物理试卷。学生画了一个球从斜面滚下来的轨迹图,你怎么判断对错?你不会只看最后那个数字答案,你会去检查:球滚动的方向对不对,速度变化合不合理,有没有凭空多出一股力。你脑子里其实同时运行着好几个小检查程序,每个负责一个方面,最后你把这些检查结果汇总起来,给出一个分数,还能告诉学生错在哪一步。
现在的问题是:这套批改流程,机器能不能做到?
这正是一群来自清华、北大、NVIDIA、上海交大、浙江大学等机构的研究者们在 2026 年 8 月抛出的问题。他们瞄准的对象是世界模型,一类试图通过生成视频来模拟真实物理世界如何演变的AI系统。而他们发现的问题是:现在评价这些模型的方法,基本上还停留在"看分数,不问过程"的原始阶段。
世界模型是什么,评估它为什么这么难
先说清楚世界模型在干什么。
**世界模型*:一种AI系统,输入是当前观察到的画面加上一个动作指令(比如"让机械臂抬起勺子"或者"镜头往左转"),输出是这个动作执行后世界会变成什么样的视频画面。**
它和普通的视频生成模型不一样。普通视频生成模型是"你给我一句话,我给你一段视频",一次性的,产出即结束。世界模型则要支持持续的交互:摄像机可以一直移动,机械臂可以持续做动作,而且模型要记得"刚才发生了什么",这样才能保证世界的状态是连贯演化的,而不是每一帧都凭空重新想象一个新世界。
论文里用了一个公式把这件事讲清楚,不难理解:世界模型要做好三件事。第一,根据当前的隐藏状态,把画面渲染出来,画面得清晰可信。第二,根据你给的动作,把状态正确地更新,你说往左转,它就该往左转,不能往右转还给你一个理由。第三,在很长的一段时间里,把这个状态维持住,不能你转身回来发现房间的墙变了颜色。
这三件事听起来简单,但评估起来极其棘手。原因在于,判断这些事情是否做对了,门槛比判断"这段视频好不好看"高得多。你得先在画面里把机械臂、勺子、碗都定位出来,追踪它们在时间轴上的变化,再验证这个变化是不是因果合理的、是不是符合物理规律的。这活儿人类做起来毫不费力,一眼扫过去就能看出"这个动作不对劲",但过去所有的评测基准,靠的都是固定的打分公式,一套死板的规则套在所有情况上,给不出任何解释,只吐出一个数字。
这就好比你去医院拍了张CT片,医生不给你讲哪里有阴影、哪里正常,只甩给你一个"综合评分72分"。你信不信这个分数?你能拿这个分数去改善身体状况吗?大概率不能,因为你压根不知道问题出在哪儿。
如果继续沿用这种"黑箱打分"的老办法,后果是什么?论文里给出了非常具体的答案,我们后面会讲到,数字差得不是一星半点。
核心思路:把评估这件事也变成一个智能体
研究者们的解法,借用了大语言模型圈子里已经很成熟的一个概念,叫做harness。
**评估harness*:不只是跑分脚本,而是一整套支撑智能体完成复杂工作流的脚手架系统,包括证据收集、工具调用、多步推理这些能力。**
他们的洞察是:人类评估视频的过程,本身就是一套工作流程,既然是工作流程,那就可以被"harness化",变成一个可执行、可复用、可扩展的智能体系统。这个系统被命名为HarnessEval-W。
它的核心设计逻辑是层级分解。给定一个评估案例,顶层的智能体先读懂这个案例的上下文,判断这次要考察的是"画面质量"、"动作执行得对不对"还是"世界状态维持得住不住",然后把任务路由给对应的技能。每个技能不是直接给出一个分数,而是继续往下拆,拆成一堆可以独立验证的小问题,每个小问题交给一个专门的子智能体去查证,子智能体带着量身定制的上下文和诊断工具,专注回答自己那一个具体问题。最后,母智能体把所有子智能体收集回来的证据核实一遍,汇总成最终的判断。
这套设计跟公司里项目审计的做法很像。一个大项目的审计,不会让一个人从头看到尾然后给个"通过/不通过"。财务专员查账目,法务专员查合同条款,技术专员查交付质量,每个人只对自己负责的那部分负责,最后审计主管把各条线的报告汇总,写出一份有理有据的审计意见。如果不这样拆分,让一个人独自扛下所有维度的判断,那这个人要么漏掉细节,要么被信息量淹没,给出的结论大概率含糊其辞,经不起追问。
论文里给了一个具体案例特别能说明问题。有一个任务是让机器人右边的机械臂抬起木勺,悬在玻璃碗上方,左边机械臂保持不动。三个不同模型生成的视频,子智能体逐一检查:目标是否可见清晰、变化是否发生在正确的目标上、有没有发生额外的意外事件、最终状态是否匹配预期。结果A模型被查出凭空多出了一把额外的勺子,B模型的左手不该动却动了,只有C模型全程干净利落。最终的三个分数是0.582、0.750、0.913,这个分差不是拍脑袋定的,而是能一步步倒推回具体哪个子问题答错了。
三条评估轴线:把世界模型的能力拆成可测的东西
光有"分层评估"这个架子还不够,还得知道具体要测哪些东西。研究者们从前面提到的那个数学公式里,提炼出了三条评估轴线,总共对应八个细分的评估设置。
**观察质量**:考察的是模型渲染当前世界状态的能力,包括画面感知质量、时间上的连贯性、以及场景里各种实体、属性和事件是否清晰可辨认。这是所有后续评估的地基,如果连画面都看不清楚,后面的一切判断都无从谈起。
**转变正确性**:考察的是动作执行是否忠实。这里又细分成三种,探索性转变考察镜头视角或位置的变化是否合理,意图性转变考察指定的物体、关系或事件是否按要求改变了,物理性转变考察一次物理干预是否引发了应有的动力学反应,比如推一下箱子,箱子该动,而不是纹丝不动或者飞出十米远。
**世界持续性**:考察的是随着时间推移,整个世界状态是否维持了连贯。这里包含漂移抵抗力,长时间的漫游过程中,场景的整体布局、风格、外观是否始终保持一致;重访一致性,观察者离开一个地方再回来,那个地方或物体是不是还是原来那样;离屏演化,一个本该持续进行的过程,比如交通、烟雾、流水,在没被镜头拍到的时候是不是还在正常运转,而不是被冻结或者重置。
这里有个细节很值得琢磨:世界持续性不要求世界一动不动地"冻住"。恰恰相反,该变的要继续变,不该变的要坚决不变。这跟你出门时告诉家里的猫"别乱跑"是两回事,你不是希望整个屋子静止不动,你是希望猫在你回来之前还是那只猫,但屋外的太阳该落山还是得落山。如果评估标准图省事,把"持续性"简单粗暴地理解成"啥都不能变",那模型就会被逼着生成一个死气沉沉的静态世界,这显然背离了世界模型本该具备的能力。
案例是怎么造出来的:一条自动化流水线
光设计好评估维度还不够,得有足够多、足够真实、足够能诊断问题的测试案例。研究者们又搭了一条agentic的案例构建流水线。
流程分成三步。第一步是场景分类抽样,他们设计了一个六维度的场景分类体系,涵盖环境(室内、室外、过渡空间)、前景实体(人、车、可操作的物体)、中景结构(走廊、人行道、工作台)、场景密度、视觉风格(写实、电影感、游戏引擎风、动漫)、观察视角(第一人称、第三人称)。系统从中抽样组合出一个具体的世界设定,同时会检查语义上的兼容性,避免抽出"沙漠里有一艘游艇"这种荒诞组合。
第二步是概率族分配,给每个案例指定一种交互类型,决定这次要考验模型的哪种能力,比如探索性转变、意图性转变、漂移抵抗力等等。不同的概率族对场景本身也有要求,比如探索性转变需要一条可以走的路线或者稳定的空间地标,意图性转变则需要一个清晰可见、状态明确的操作目标。
第三步是智能体案例撰写,这里又用了三个agent接力:图像生成器把抽样出来的元数据转成图像生成提示词,产出初始画面;图像引导规划器盯着这张图,琢磨出一个具体可行、有据可查的动作,比如文字指令、摄像机轨迹、控制序列;案例验证器最后把关,检查目标是否可见、动作是否可行、预期结果是否足够具体,不合格的案例打回去重新抽样。
**这套流水线最终产出了330个评估案例,覆盖18个具有代表性的世界模型。**
这个验证闭环特别值得说一说。它不是让人一条条案例去审,而是把"值不值得深究"这件事也交给智能体判断,只有拿不准的边界案例才需要额外的人工介入。这跟工厂质检的抽检逻辑异曲同工:流水线上跑得好好的产品不需要每个都拆开检查,真正值得花时间的是那些卡在合格线附近的产品。如果反过来,每个案例都靠人工从头审到尾,330个案例造出来估计得耗费几个月,根本没法跟上世界模型迭代的速度。
谁在评测中胜出,又是为什么
把这套评估系统跑起来,评了18个具有代表性的世界模型,涵盖三种不同的控制接口:靠文字提示驱动的通用视频生成模型、靠原生动作指令驱动的模型、靠摄像机位姿驱动的模型。
结果显示,排名靠前的几乎清一色是文字驱动的通用视频生成模型。Seedance 2.0拿到总分75.5分排名第一,紧随其后的是Wan 2.7的75.0分、Kling 3.0的74.4分、MiniMax H3的74.3分。
这个结果背后的逻辑其实不难理解。这些模型经过大规模的文字条件训练,对"一个指令背后到底该发生什么"有更强的语义理解和预测能力,而这恰恰是意图性转变和物理性转变这两项最考验的能力。反过来,那些靠原生动作或摄像机位姿驱动的模型,虽然在探索性场景和持续性表现上有优势,但在处理"精确执行一个具体意图"这件事上明显吃亏。
比如SANA-WM在离屏演化这一项上拿到全场最高的72.3分,HY-WorldPlay 1.5在重访一致性上拿到81.9分全场第一,但它们在意图性转变上的得分只有50.6和49.9,差不多是排名靠前模型的六成。这说明不同模型的能力分布其实是有明显偏科的,而这种偏科,单靠一个笼统的总分是完全看不出来的,必须靠拆分出来的这八个细分指标才能暴露出来。
HarnessEval-W自己靠不靠谱
设计一个新的评估系统,最大的问题永远是:这个评估系统本身可信吗?会不会它给出的排名跟人类的真实感受根本对不上?
研究者们做了三方面的验证。
第一是跟人类判断的一致性。他们找了一批标注员,两两比较不同模型生成的视频,收集了5000组"哪个更好"的判断,用Bradley-Terry模型算出每个模型的人类偏好强度。结果显示,HarnessEval-W给出的分数跟人类偏好排序的相关性,在意图性转变上达到斯皮尔曼相关系数0.93,在物理性转变上达到0.87。这个数字什么概念?相关系数超过0.9,基本可以理解成"机器打的分,跟人类的直觉判断几乎是同一个方向"。
第二是跟已有评测基准的正面对比。他们挑了WBench里最接近的两套协议,Event Edit对应意图性转变,Causal Fidelity对应物理性转变,用完全相同的模型和相同的视频重新跑一遍,只有评估协议本身不同。结果非常悬殊:在物理转变这一项上,WBench的配对准确率只有31.9%,HarnessEval-W是71.7%,足足高了将近40个百分点。更夸张的是打平率,WBench有52.2%的对比给不出区分度,直接判成平局,而HarnessEval-W只有1.8%的平局率。
这个差距是什么概念?意味着WBench在一半以上的对比里,压根说不出哪个模型更好,只能摊手认输。而HarnessEval-W几乎每次都能给出一个明确的高下判断。原因就在于它把一个笼统的整体判断拆成了很多个各自有独立证据支撑的小问题,拆得越细,分辨率越高,自然就不容易出现"分不出胜负"的尴尬局面。
这就像你去买手机,如果只问店员"这两个哪个更好",他大概率会含糊地说"都还不错吧",因为这个问题太笼统了,没有一个具体的比较维度。但如果你问"哪个拍照更清晰、哪个电池更耐用、哪个屏幕更亮",店员立刻就能给出具体的答案,而且答案之间大概率不会完全打平。
第三是稳定性验证。同一套评估系统,用同一个GPT-5.5后端跑三次,温度设成0,理论上每次结果应该差不多。结果显示HarnessEval-W三次运行的拟合曲线斜率范围只在9.6到10.8之间波动,相关性稳定在0.928到0.964,三次结果的包络带宽度只有0.33个单位。反观WBench,斜率从11.2一路飘到21.0,几乎翻了一倍,相关性在0.646到0.780之间大幅摆动,包络带宽度达到1.61,是HarnessEval-W的4.9倍。
这个稳定性差距,某种程度上比准确率的差距更让人担忧。一个评测系统如果今天跑出来的排名和明天跑出来的排名差异很大,那这个评测系统给出的分数就没法当作可靠的参考依据,今天说A模型好,明天可能又说B模型好,这样的评测工具毫无实用价值可言。
一些更深层的发现
除了给18个模型排名,研究者们还挖到了几个挺有意思的规律。
第一个是评估维度之间的相关性分析。他们发现意图性转变和物理性转变的相关系数高达0.98,几乎是同步波动的,这不难理解,两者都要求模型理解一个具体干预背后的语义,并生成对应的后果。但探索性转变跟这两者几乎不相关,相关系数只有负0.15和负0.18。这说明一个模型能生成流畅自然的探索性漫游画面,并不代表它就有能力精确执行一个具体的指令,这是两种截然不同的能力,不能互相替代。
第二个更有意思,是关于"微调"这件事的观察。研究者们对比了两组模型:Wan 2.2微调成DreamX-World,HunyuanVideo 1.5微调成HY-WorldPlay 1.5。这两组模型都是从通用的文字驱动视频生成模型,进一步微调成支持动作交互的世界模型。
结果显示了一个非常一致的趋势:微调之后,探索性转变分数上升了4.6到4.4分,重访一致性大幅上升6.5到12.5分,但意图性转变分数暴跌11.9到23.3分,物理性转变也下跌7.7到11.7分。
这说明什么?**把一个视频生成模型改造成世界模型,能力并不是均匀提升的,而是发生了重新分配。**
研究者们推测,这可能跟微调数据的分布有关,微调过程中大量使用的是探索式的漫游轨迹数据,而缺少足够多带有精确指令干预的训练样本,导致模型在"擅长闲逛"和"擅长精确执行命令"之间,悄悄把天平往前者倾斜了。
这就好比一个原本什么菜都会做一点的厨师,突然被要求专精中餐,结果他确实把中餐做得更地道了,但西餐的手艺却生疏了不少。如果不专门去衡量这种此消彼长,你可能会误以为"微调之后模型全面变强了",但实际上它只是在某些方面变强,同时在另一些方面明显变弱了。
这套系统还打算往哪儿走
论文最后提出了三个方向,想让这套评估系统持续进化。
第一是测试时算力扩展。既然模型生成越来越复杂的推理链条需要更多算力,评估过程理论上也该同步扩展,用更多算力换取更细的技能拆解、更深的子智能体搜索、更多轮的证据复核。
第二是技能库的持续扩张。未来的世界模型会覆盖越来越广泛、越来越精细的场景,评估系统得跟着长出新技能,而不是每出现一个新场景就重新写一套评测规则。
第三是让评估系统具备自我进化的能力。当系统碰到一个现有技能库解决不了的新场景时,这本身就是评估系统能力边界的一次暴露,研究者希望未来能让系统自己把这个能力缺口补上,写回技能库里,形成一个不断自我完善的闭环。
写在后面
读完这篇论文,最触动我的其实不是那个75.5分的排行榜,而是那个微调实验的发现。一个模型从通用视频生成器变成交互式世界模型,不是能力的整体升级,而是能力版图的重新划分,有些地方涨了十几分,有些地方跌了二十几分。这打破了我一个原来没细想过的默认预期:我以为"微调成专用模型"应该是在原有能力基础上叠加新能力,但实际情况更像是拆东墙补西墙。
另一个值得单独说的细节是WBench在稳定性测试里暴露的问题,同一套系统跑三次,斜率能从11.2跳到21.0,几乎翻倍。这提醒我们,评估工具本身的可靠性,和它的准确率同样重要,甚至更重要,一个不稳定的尺子,哪怕平均值看起来还行,也没法用来做真正的决策依据。
论文里没有细讲的一个问题是,这套子智能体分层评估的方法,计算成本到底有多高。当评估案例从330个扩展到几万个、模型从18个扩展到上百个的时候,这套需要层层调用大模型做推理的系统,是不是还跑得动、还负担得起,这大概是接下来最实际的一个问题。
Q&A
Q1:HarnessEval-W是什么?
A:HarnessEval-W是一套用来评估交互式世界模型的智能体化评测系统,它不是套用固定打分公式,而是让智能体分层拆解每个评估问题,分派给专门的子智能体去核查具体证据,最后汇总出可追溯的评分和完整推理链。
Q2:HarnessEval-W评估了哪些世界模型,结果怎么样?
A:研究者们评估了18个具有代表性的世界模型,涵盖文字驱动、原生动作驱动、摄像机位姿驱动三种类型,总分排名第一的是Seedance 2.0,得分75.5,但不同模型在观察质量、转变正确性、世界持续性等细分维度上表现差异很大,没有绝对的全能冠军。
Q3:世界模型微调后能力会全面变强吗?
A:不会。论文对比了Wan 2.2微调成DreamX-World、HunyuanVideo 1.5微调成HY-WorldPlay 1.5两组案例,发现微调之后探索性和持续性能力明显提升,但意图性转变和物理性转变能力反而大幅下降,说明微调是能力的重新分配而非整体提升。
热门跟贴