X:https://x.com/NVIDIAAI/status/2105051552029556942
从一块黄油如何融化,到 Physics-IQ Verified 的榜一,视频里的物理细节值得被重新描述一遍。
给视频模型一句「黄油受热融化」,它该生成什么?
一块逐渐变小的黄油、一圈向外扩散的液体,还是一团突然瘫软的黄色物体?这句话点出了事件,却省略了中间的过程。热量如何改变状态,重力如何影响形状,固体缩小与液体铺展怎样同时发生,都需要模型自己补全。
英伟达联合 MIT 和牛津大学的研究团队提出的 Physis-Lang,就从这些经常被省略的细节入手:把物理原因、规律和结果写进语言描述,再让这套描述贯穿数据筛选、模型训练和视频生成。
视频链接:https://mp.weixin.qq.com/s/D6b1FbGx-Zvzknnlt9zzPw
视频 1|Physis-Lang 完整演示:物理语言表征、描述准则自进化、数据检索及视频生成结果。
图 1|Physis-Lang 论文标题、作者及研究机构。
在权威榜单 Physics-IQ Verified 上,Physis-Lang 的 Cosmos3-Super 和 Cosmos3-Nano 版本分别以 48.2 和 43.3 的得分,按平均分位列第一、第二。
图 2|Physics-IQ Verified 榜单对比。Physis-Lang 的 Super 与 Nano 版本按平均分位列第一、第二,Super 较此前最高分提升 5.5 个百分点。
- 榜单地址:https://physics-iq-verified.anates.ai/
其中,Super 比图中此前最高的 42.7 分高出 5.5 个百分点;16B 大小的 Cosmos3-Nano 加入 Physis-Lang 以后,均分也超过了原始 64B 大小的 Super 模型。一个值得追问的问题是:语言描述究竟改了什么,能把提升传递到生成的视频里?
在训练和推理的 caption 中,细致地注入物理过程
普通视频 caption 往往擅长交代场景:画面里有什么,谁做了什么动作。Physis-Lang 进一步要求描述物体之间的作用,以及这种作用如何推动后续变化。
Physis-Lang 在基础描述之外加入物理推理信息。训练时,它为真实视频重新生成更细致的文本监督;推理时,它扩展用户的简短输入,并补充与当前场景相关的负向描述,约束不合理的物理行为。
还是黄油的例子。更完整的描述可以是:持续加热使黄油逐渐融化,固体部分在重力作用下塌落,体积不断缩小,融化后的液体在周围形成逐渐扩大的浅层液池。
这段话给出了连续的状态变化。生成模型需要表现的,不再只有「黄油」和「融化」两个概念,还有升温对物态的影响,固体与液体之间随时间变化的关系。
但描述更长,也可能意味着编造更多。模型如果把看不见的原因写得头头是道,反而会引入错误监督。因此,这项工作的关键,是让物理描述能够被检查,并据此持续改进。
评价 caption 物理细致程度的 PhysCapBench
& 自进化的 caption prompt
视频链接:https://mp.weixin.qq.com/s/D6b1FbGx-Zvzknnlt9zzPw
视频 2|描述准则的自进化流程:固定标注模型,根据物理评估反馈迭代共享的 caption prompt,并通过 PhysCapBench 验证。
研究团队为此构建了 PhysCapBench:一个评判视频描述中物理细节是否充分、是否正确的 benchmark。它包含 246 段物理视频,以及 3,794 条经过人工核验的原子断言,平均每段视频约 15.4 条。
所谓原子断言,可以理解为能够单独判断真假的物理陈述。例如,杯子撞上硬物后破裂,评估时会先将碰撞、受力和破裂的整个过程分解为逐条简短的物理陈述,再逐一评判,而不是笼统地给整段文字打一个印象分。
评分分为两个方向:Precision 检查描述说出的内容有没有依据;Recall 检查人工标注的物理信息有没有被覆盖。两者合成 F1,让「写得对」和「写得全」都有了可比较的尺度。
有了这把尺子,自进化才有明确的反馈。系统先在固定的 20 段开发视频上生成描述,由物理评估器指出遗漏和错误,再交给进化智能体修改共用的描述准则。更新后的准则还要在 PhysCapBench 上验证,最后选出表现最好的版本。
这个过程中,标注模型的权重保持不变。每轮修改的是所有视频共用的 caption prompt,而不是逐条给某个视频的答案「打补丁」。
图 3|描述准则自进化带来的收益。左:PhysCapBench F1 从 78.64 提升至 87.82;右:固定生成模型,仅更新推理描述,PhyGenBench 得分从 64.17 提升至 67.29。
从第 1 轮到第 9 轮,PhysCapBench F1 从 78.64 升至 87.82。改进并非一路向上:第 2 轮一度降至 76.28,论文将其归因于过于谨慎的描述。这也说明,少说虽然可能少犯错,却会丢掉必要的物理信息。
此外,固定预训练 Cosmos3-Nano,仅改变推理时的描述,PhyGenBench 得分就从 64.17 提高到 67.29。caption 端的改进,确实能够传到生成端。仅通过语言的自进化,不仅提升了多模态模型的物理理解能力,也进一步提升了视频模型的物理生成能力。
语言这一表征还能更好地用于数据筛选
图 4|语言引导的数据检索流程及效果:将模型的物理能力短板转为检索标签,补充相关真实视频并重新标注,用于增强训练数据。
语言的作用还延伸到了数据筛选。假如模型总是在物理形变、碰撞或断裂上出错,继续随机增加视频,未必能补上这些短板。
Physis-Lang 将模型暴露出的不足转成物理领域标签,再据此检索真实视频。检索更关注视频包含什么物理过程:即使画面主体、颜色和背景不同,只要涉及需要补充的物理机制,也可能是有价值的训练样本。
最终的数据集包含 183K 段真实视频。其中,71K 段来自 WISA-80K 数据集,另外 112K 段通过这套检索流程补充。它们再由优化后的描述准则进行重新标注,用于模型训练。
图 5|检索数据带来的分物理类别收益。横轴为 VideoPhy-2 联合得分的提升幅度(百分点),括号内为各类别样本数。
细分到物理类别,在 VideoPhy-2 上,化学过程和热过程都提升了 8.00 个百分点,断裂力学提升 7.45 个百分点,布料形变提升 7.19 个百分点。这些结果更直接地展示了数据补充对应的能力变化。
这样一来,语言就把几个环节接了起来:先描述物理过程,再用描述发现问题、寻找数据,最后把补充的数据和改进的描述一起用于训练。
四项物理评测开源 SOTA,三项超越 Veo 3.1
Physis-Lang 的优势,直接体现在与领先视频生成模型的对比中。基于 Cosmos3-Nano 的版本,在论文评测的四项物理 benchmark 上,均取得参评开源模型及方法中的最佳表现;其中三项总分超过 Veo 3.1。
这组实验同时覆盖图生视频和文生视频。对手既包括 Veo 3.1、HunyuanVideo-1.5、Wan2.2 等通用生成模型,也包括专门改善物理表现的方法。四张完整结果表如下。
看看生成的视频里发生了什么
从碰撞的传递,到纸张撕裂、受压形变,下面几段生成样例展示了不同的物理过程。
视频链接:https://mp.weixin.qq.com/s/D6b1FbGx-Zvzknnlt9zzPw
视频 3|接触与碰撞:基于 Cosmos3-Nano 生成的木块依次倾倒样例,展示接触作用下的运动传递。
视频链接:https://mp.weixin.qq.com/s/D6b1FbGx-Zvzknnlt9zzPw
视频 4|受力撕裂:基于 Cosmos3-Super 生成的纸张样例,展示向两侧拉动时的形变与裂口扩展。
视频链接:https://mp.weixin.qq.com/s/D6b1FbGx-Zvzknnlt9zzPw
视频 5|负载下的形变:基于 Wan2.1-14B 生成的壶铃与枕垫样例,展示重物接触后柔软材料的凹陷与形变。
结语
Physis-Lang 把一个容易被忽略的问题摆到了台前:我们交给视频模型的语言,是否充分描述了它需要学习的物理过程?黄油融化、纸张撕裂、枕垫受压,这些看似简单的事件,都包含具体的物理作用关系和状态变化。将它们描述清楚,才能为训练和生成提供更充分的物理信息。
从主实验中的四项开源 SOTA,到最新 Physics-IQ Verified 榜单对比中 Super 达到 48.2 分、Nano 达到 43.3 分,这项工作给出了可以量化的答案。通过描述准则自进化、针对能力短板的数据检索,以及贯穿训练与推理的物理语言,Physis-Lang 让这些细节转化成了生成表现上的提升。
让世界模型更好地理解物理,可以从重新优化语言这一重要表征开始。
热门跟贴