消除照片中的路人、杂物,现在已经是节假日出片的“必备神器”,AI消除的能力逐步从图片拓展到视频,但既要补全单帧内容,还要确保单帧内空间连贯性和帧间时序一致性,使得视频目标移除的难度明显上升。
目前主流的方法是基于扩散模型“从噪声到数据”的生成范式,即以无信息的高斯噪声为起点逐步重建,这一过程丢弃了源视频中大量有效的结构与场景先验,在面对大范围遮挡或需要生成复杂物理逻辑的内容时,往往导致物体消除不彻底,或生成与场景相悖的内容,因此一般通过引入参考帧引导机制进行解决,但该机制显著增加了系统复杂性。
对此,美图影像研究院(MT Lab)提出基于随机桥模型的新框架——BridgeRemoval,首次将“视频目标移除”定义为“视频到视频的翻译任务”,通过构建基于随机桥(VP-SDE Bridge)的直接生成路径,更好地平衡背景保真度与生成灵活性,显著提升视频目标移除精准度与画面内容时空逻辑一致性。该成果近期已被机器学习领域三大顶级会议之一的ICML 2026(International Conference on Machine Learning)录用。
论文链接:https://arxiv.org/pdf/2601.12066项目主页:https://bridgeremoval.github.io/
BridgeRemoval的架构是将源视频输入通过冻结的VAE编码器投射至隐空间,基于VP-SDE Bridge 构建一条直接从源视频先验(z_src)到干净目标(z_tgt)的插值轨迹,再通过拼接掩码隐变量(z_M)与源视频隐变量(z_src)作为空间条件,与文本嵌入(c_text)一同输入基于DiT的模型进行速度预测训练。
随机桥
不同于标准扩散模型从随机高斯噪声起步,BridgeRemoval采用基于方差保持随机微分方程(VP-SDE)的桥模型,将被遮挡的源视频天然作为生成过程的强前置约束,生成轨迹牢牢地被锚定在输入源视频的结构之上。模型的训练目标被定义为学习从源到目标的速度场,而非去噪目标,这使得模型能有选择性地只对被遮罩区域进行变换,同时最大程度保真未被遮挡的背景内容。
基于SDE求解器的推理
在推理阶段,BridgeRemoval从源视频隐变量出发,沿所学桥模型的逆向SDE轨迹逐步靠近目标。通过解析推导的修正采样策略,BridgeRemoval保证了生成轨迹严格服从桥约束,从而在目标物体被完全移除后,能够生成背景连贯、时序稳定且画面质量更优的视频。
自适应掩码调制
当直接利用强先验移除大尺寸物体时,模型可能会因“过于忠实”源视频结构,而难以生成大面积的合理新区域。针对这个问题,BridgeRemoval提出了自适应掩码调制策略,即根据掩码的空间特征,动态调节对源视频结构的依赖程度,对有大面积遮挡的区域适当放松对源视频的结构约束,而对于有效的背景区域则保持高度保真。
定量实验结果表明,BridgeRemoval在DAVIS与BridgeRemoval-Bench两个数据集上均取得了最高的PSNR值,同时在CLIP-T上表现极具竞争力,证明了随机桥方案在目标移除与背景保留上达到了最佳平衡。
定性比较结果显示,BridgeRemoval在DAVIS和BridgeRemoval-Bench上均还原了更干净、稳定且与整体场景逻辑一致的背景。
由24名研究人员和行业专家共同参与的主观评估结果显示,BridgeRemoval在文本一致性(是否有效移除目标)、背景保真度和时序连贯性三个维度上均显著优于现有的基线方法。
目前,BridgeRemoval的相关能力已落地于美图秀秀、Wink 的“视频美型背景保护”功能,解决了瘦脸、瘦身等人像视频编辑时常出现的栏杆变弯、背景形变等尴尬问题。
该能力同时还应用于开拍APP的“智能全消”功能,支持最长5分钟视频输入,能够自动识别与消除视频文字。
热门跟贴