谢赛宁在社交平台转发介绍了V-RAE。这个模型没有走传统VAE潜空间的路子,而是直接把冻结的视觉基础模型表征拿来当视频生成潜空间。
用现成表征替代VAE潜空间
打开网易新闻 查看精彩图片
具体来说,V-RAE采用的表征来自DINOv3、SigLIP2、EUPE和V-JEPA 2.1。这些视觉基础模型被冻结后,其输出直接作为视频生成的潜空间使用。
匹配设置下指标表现
在匹配设置下,V-RAE在Kinetics-600上达到2.13 rFVD,在UCF101上达到117.86 gFVD。收敛速度方面,比VAE潜空间快6倍。
此外,V-RAE还引入了tFVD来评估时序平滑度。
热门跟贴