打开网易新闻 查看精彩图片

这项由卡内基梅隆大学多个实验室联合完成的研究以预印本形式发布于2026年6月,论文编号为arXiv:2606.23688,项目名称为Lift4D。感兴趣的读者可通过该编号检索完整论文及配套演示网站。

用一段手机拍的视频,重建出物体360度的完整外形,还能追踪它每一帧的动作变化——这件事听起来像魔法,但卡内基梅隆大学的研究团队正在把它变成现实。

你有没有想过,当你用手机拍一只猫打滚,或者拍一头犀牛踱步,摄像头只能看到猫或犀牛对着镜头的那一面。猫的背脊、犀牛的另一侧身体,还有那些被树枝或人群遮挡住的部分,摄像头一概看不到。然而你的大脑却能轻松"脑补"出完整的画面——你知道猫的背后有毛、犀牛的另一侧也有角。

这种"脑补"能力,正是Lift4D这套系统想要赋予计算机的。

一、 当AI面对一段普通视频,它的困境是什么?

把一段单镜头视频变成完整的三维动态模型,难度远超大多数人的想象。这个问题有一个专业的叫法——"单目4D重建",其中"单目"代表只有一个摄像头,"4D"代表三维空间加上时间这第四个维度。

要理解这件事为什么难,可以用一个简单的比方。假设你只有一张从正面拍摄的雕塑照片,要你凭此画出这座雕塑从背面、侧面、俯视看起来是什么样子,同时还要把它在不同时刻的姿势变化全部记录下来——这就是计算机面对的挑战。信息严重不足,任何人都只能猜。

现有的方法大致分两条路。一条路是直接训练AI学会从视频预测4D模型,但问题在于,真实世界里带有精确3D标注的动态视频数据极度稀缺,AI学到的知识大多来自合成的动画素材,遇到真实世界里的猫、人、动物就容易出错。另一条路是先用AI猜出物体的初始3D形状,再用视频里的信息慢慢调整,但这个"调整"过程缺乏持续的智能辅助,遇到大幅度运动或遮挡就容易垮掉。

Lift4D选择了第三条路:在整个重建过程中,始终让一个强大的3D感知能力在场,同时专门设计了应对遮挡问题的机制。

二、 整体思路:像一位有记忆的雕塑家

Lift4D的工作方式可以类比成一位有特殊能力的雕塑家。这位雕塑家在看过视频的第一帧画面后,立刻在脑海里构建出物体的完整立体形象,包括他看不到的背面。然后,每当视频播放到下一帧,他不会推翻重来,而是把上一帧积累的印象带入新的判断,让自己的理解随着时间连贯地演进。最后,他把所有帧的理解融合进一个统一的、会动的3D模型,并且专门处理那些被遮挡的部分,用合理的推测填补空缺。

这个过程分三个阶段:首先,用一个改造过的"单张图片转3D"的AI模型,逐帧生成时间上连贯的3D重建结果;其次,把这些逐帧结果提炼进一个可以变形的统一3D表示;最后,用一个懂得看图补全的图像AI,把遮挡区域和从未被拍到的区域填充完整。

三、 第一步:让AI记住上一帧看到的形状

Lift4D用到了一个叫SAM3D的先进模型,这个模型的能力是给它一张图片,它能生成对应物体的3D高斯点云模型。高斯点云是一种用密集的小"气泡"来描述三维形状和颜色的技术,每个气泡有自己的位置、大小、方向和颜色,组合起来就像一团栩栩如生的彩色云朵,渲染起来又快又好看。

然而,如果对视频的每一帧单独运行SAM3D,得到的结果就像是由一堆毫无关联的雕像拼凑起来的幻灯片——前一秒物体朝左,下一秒朝右,形状也突然变了,根本无法用来追踪运动。

为了解决这个问题,研究团队设计了一种叫做"因果潜变量传播"的机制。这个名字听起来复杂,但核心思路非常简单:当AI处理第一帧时,它从零开始推理,生成一个描述该帧形状的"记忆编码";处理第二帧时,它不从零开始,而是把第一帧的记忆编码混入新一帧的初始状态,就像一个学生做题时把上一道题的答案草稿留在纸上,作为下一道题的参考。这个"混入"的比例由一个参数控制,默认情况下设置为让上一帧的影响占20%,当前帧的全新信息占80%。这样,AI既不会完全忘记过去,也不会因为过去太固执而看不清现在。

处理完整段视频后,每一帧都有了自己的3D重建结果,而且这些结果在时间上是连贯的——物体不会无缘无故地左右跳动,形状也保持合理的连续性。

四、 第二步:把零散的帧提炼成一个会动的统一模型

逐帧生成的3D模型解决了时间连贯性,但仍然有一个根本问题:每一帧的高斯点云都是独立的,第1帧里代表犀牛鼻子的那个气泡,和第2帧里代表同一个鼻子的气泡,在数学上毫无关联。这就好比用乐高积木搭了一系列摆出不同姿势的小人,但每个小人都是全新搭建的,积木之间没有任何物理连接。

Lift4D的解决方案是构建一个"正则形态"——可以把它理解成一个标准参考姿势下的基础模型,就像芭蕾舞演员的"站立准备姿势"。这个基础模型由一组固定的高斯气泡组成,然后配备了一套稀疏的"控制节点",就像木偶的关节控制点。一个可学习的变形网络负责根据时间信息,告诉每个控制节点该如何旋转和移动,所有气泡则跟随最近的控制节点一起变形,就像皮影戏里绑了线的皮影随着线的牵动而改变姿势。

为了让这个变形模型学得准确,研究团队设计了两种监督信号。一种是"倒角距离损失",它衡量变形后的基础模型里每个气泡,和对应帧逐帧重建结果里最近气泡之间的距离,督促它们尽量靠近。另一种是"多视角渲染损失",它在物体周围的虚拟球面上随机选一个观察角度,分别渲染基础模型和逐帧模型,然后比较两张图的像素差异和结构差异,让它们看起来尽可能一致。

此外,为了防止变形网络过度拟合单帧的噪声而产生抖动,研究团队还加入了两种正则化约束:一种要求相邻控制节点的运动保持局部刚性(就像人体的骨骼运动时局部肌肉不会乱扭),另一种要求相邻帧之间控制节点的位置变化尽量平滑(就像人在走路时脚不会突然跳到两米外)。

五、 第三步:填补遮挡与未见区域的外观

即便有了连贯的几何形状,外观质量还有一个棘手的问题。现实视频里,物体常常被其他东西遮挡:犀牛被灌木丛遮住腿,跳马的运动员被裁判员的手臂遮住胸口。如果直接把视频像素当作"标准答案"来训练模型,被遮挡的地方就会给模型传递错误的信号,让它误以为那些位置的外观就是遮挡物的样子。

Lift4D设计了一套"遮挡感知渲染监督"机制来专门解决这个问题。具体来说,它先用一个单目深度估计工具(Depth Anything 3)来判断场景里每个像素距离摄像头的远近,再把这个深度图和3D模型渲染出的深度图做比较。如果场景深度图显示某个位置的物体比3D模型显示的更近,说明那个位置有东西在"挡着"目标物体。同时结合物体分割掩码(用SAM3工具生成),就能精确找出哪些像素是属于目标物体但被遮挡了的区域。

找到遮挡区域之后,系统不是直接忽略它,而是用一个聪明的替代方案:把逐帧3D重建模型从当前视角渲染出来的图像,与输入视频在可见区域的颜色统计信息做匹配——简单说就是调整一下色调、对比度和饱和度,让重建图像的整体配色风格和真实视频相近。经过这种"色彩矫正"之后,重建图像就成为了遮挡区域的合理替代参考。最终的"完整参考图像"由两部分拼合:没被遮挡的区域用真实视频像素,被遮挡的区域用色彩矫正后的重建渲染来填充。

然而,即便遮挡处理完了,还有另一个更根本的问题:摄像头从来没有拍到过物体的背面。这些区域在任何一帧里都是空白的,没有任何像素信息可以参考。对于这些区域,Lift4D引入了一个叫做Zero-1-to-3(升级版称为Stable Zero123)的图像扩散模型——这是一种专门根据已知视角的图像来"想象"其他视角看起来应该是什么样子的AI。

使用这个扩散模型的方式是评分蒸馏损失(LSDS):在物体周围随机选一个新视角,用3D模型渲染出该视角的图像,把这张图送进扩散模型,扩散模型基于已知的"完整参考图像"来预测这个角度应该有的合理外观,然后把3D模型的渲染结果往这个预测拉近。关键的设计细节在于,扩散模型接收的参考是已经处理过遮挡的完整参考图像,而不是原始的、有遮挡的视频帧,这让扩散模型的"想象"质量大幅提高,不会被遮挡物误导。

整个外观优化阶段会冻结之前学到的几何变形参数,只优化外观属性和一套额外的细粒度控制节点,确保精细的外观调整不会破坏已经学好的几何结构。

六、 实验结果:在合成数据和真实野外视频上的比较

研究团队在两个场景下验证了Lift4D的效果。

第一个场景是Consistent4D合成数据集,里面有7种不同的合成3D物体,包括骷髅头、手枪、宇航员、三角龙等,每个物体都有32帧的输入视频和4个新视角的真实渲染结果作为标准答案。在感知相似度(LPIPS,数值越低越好)方面,Lift4D达到0.116,优于排在第二位的DM4D的0.128,以及PAD3R的0.137。在视频连贯性和真实感(FVD,数值越低越好)方面,Lift4D达到592.44,大幅优于第二名PAD3R的645.09。在语义相似度(CLIP分数,越高越好)方面,Lift4D达到0.950,同样领先。换句话说,Lift4D重建出来的4D模型,从各个新角度看都最接近真实的样子,而且时间上最连贯。

第二个场景是真实野外视频,包括10个来自Pexels的公开视频和8个来自DAVIS数据集的视频,涵盖跑动的骆驼、踱步的犀牛、跳跃的马匹、奔跑的狗、骑马的人等多种场景,部分视频中目标物体会被遮挡。由于没有真实的新视角视频作为标准答案,评估改用CLIP语义分数衡量重建质量,以及终点误差(EPE)衡量运动追踪精度——EPE越低,说明3D模型估计的运动轨迹与真实运动越吻合。

在Pexels数据上,Lift4D的CLIP分数达到0.780,远高于第二名STAG4D的0.757,同时EPE仅为0.072,而第二名PAD3R是0.119,几乎是Lift4D的1.7倍。在DAVIS数据上,Lift4D同样以0.715对0.637(第二名V2M4)和0.161对0.189(第二名STAG4D)的成绩全面领先。这些数字背后的含义是:Lift4D不仅外观重建得更好,它对物体运动的理解也更准确,模型内部的3D几何在时间上真正对应着物体实际移动的轨迹。

消融实验(即逐步去掉某个设计组件再测试性能)进一步证明了各个设计的必要性。去掉因果潜变量传播,改成每帧独立重建,LPIPS从0.116上升到0.120,FVD从592上升到627,几何抖动明显增加。去掉运动正则化,FVD急剧恶化到794。去掉扩散模型蒸馏损失,LPIPS恶化到0.170,FVD达到1242,未观察区域外观变得平坦模糊。仅保留几何重建损失而去掉外观优化阶段,效果同样明显下降。这些结果说明,三个主要模块的设计相互依赖、缺一不可。

七、 实际运行起来需要多少时间和资源?

对于一段32帧的视频,Lift4D在一张英伟达H200显卡上大约需要30分钟完成重建。几何优化阶段和外观优化阶段各进行10000次迭代,共20000次,使用AdamW优化器。考虑到最终得到的是一个完整的、可以从任意角度渲染的4D动态模型,这个时间代价在研究社区里是相当合理的。

八、 这套方法有哪些局限和尚待解决的问题?

研究团队在论文中坦诚地指出了两个主要局限。

第一,整个流程是级联式的,最终质量在很大程度上依赖SAM3D初始重建的质量。当SAM3D对某一帧的几何形状或摄像机位姿估计出现较大误差时,这些错误会向下传播,影响后续所有阶段。对于帧率较高或者物体形状很细薄的视频(比如拍一根细竹竿),逐帧的摄像机位姿预测可能出现跳跃,优化过程难以消除。

第二,因果传播的强度参数t0目前是固定的,不同视频可能需要不同的值。对于运动非常剧烈的序列,t0偏大会压制合理的形变;对于静止或接近刚体的物体,t0偏小则可能允许不必要的几何抖动。这个超参数目前需要手动调整,未来的工作可以考虑让系统自动适配。

更长远来看,研究团队认为进一步提升SAM3D自身的几何估计能力是最有前景的改进方向,同时把Lift4D扩展到更复杂的交互场景(比如人手拿取物体时手与物体的相互遮挡和接触)也是一个值得探索的目标。

归根结底,Lift4D做的事情可以用一句话来概括:它教会了计算机像人类大脑一样,在看到片面信息时仍然能够构建出完整的三维动态世界。手机拍的一段普通视频,经过这套系统的处理,就能变成一个可以随意旋转、任意暂停、追踪每个部位运动轨迹的完整4D数字模型。这对电影制作(不需要专业动作捕捉设备)、游戏资产生成(直接从真实视频提取角色动作)、体育分析(精确追踪运动员的三维运动)乃至医学康复(分析患者运动模式)都有潜在的实用价值。当然,目前这套系统还需要高端GPU和较长的处理时间,距离普通人随手使用还有一段路要走。但每一项技术的普及都经历过这个阶段,今天的30分钟研究级处理,或许就是明天实时预览功能的前身。有兴趣深入了解的读者可以通过论文编号arXiv:2606.23688找到完整的技术细节和演示视频。

Q&A

Q1:Lift4D需要多视角摄像头才能工作吗?

A:不需要。Lift4D专门针对单个摄像头拍摄的普通视频设计,它通过因果潜变量传播和扩散模型来补全摄像头看不到的区域,不依赖多视角设备。

Q2:Lift4D重建的3D模型能用在游戏或影视制作中吗?

A:从技术原理上看是可行的。Lift4D输出的是带有完整外观的4D高斯点云模型,可以从任意角度渲染,也记录了物体随时间的形变过程,理论上可以导入到支持高斯点云的渲染管线中使用,但目前距离工业级的直接可用还需要进一步工程化。

Q3:Lift4D处理遮挡的方法是什么原理?

A:Lift4D比较场景深度图和3D模型渲染的深度图,找出被前景物体遮挡的目标像素,然后用色彩矫正后的逐帧3D重建图来替换这些遮挡区域,生成一张"去遮挡"的完整参考图,再用这张图来指导外观优化,避免遮挡物的颜色干扰最终结果。