单图生成3D资产的新思路

从一张图片生成高保真3D内容,难点在于同时还原几何结构与外观表现。如果生成结果要进入标准渲染流程、支持重新打光,还需要具备反照率、金属度-粗糙度、表面法线等物理渲染属性。研究团队提出一种名为Luce的3D表示方法,把几何与物理材质统一放进体素化的多模态高斯云中,并为每种模态使用专门的高斯基元。

打开网易新闻 查看精彩图片

这套表示随后被变分自编码器压缩成统一的材质感知潜空间。一个整流流Transformer从单张图像生成该潜表示,条件信号来自预训练图像编码器的多层特征,既保留语义上下文,也保留细粒度空间细节。

从潜表示到可重光照资产

解码阶段,潜表示会还原为可重光照的物理渲染高斯,并可选择输出带切线空间法线贴图的纹理网格。在Toys4K数据集上,Luce实现了单图到3D生成的最先进水平,FID指标相较最强基线提升28%。

研究还引入了一个AI生成图像基准。在该基准上,Luce的CLIP图像对齐分数达到0.8519,优于最佳基线的0.8299。团队表示,Luce生成的资产可重光照、几何准确、材质忠实,并能保留文字、标志和铭文等细节。

同期相关研究

同一页面还展示了另外两项工作。HeadsUp面向多视角采集场景,提出一种可扩展的前馈方法,从大规模多相机设置中重建高质量3D高斯头部。该方法使用编码器-解码器架构,将输入视图压缩为紧凑潜表示,再解码为一组UV参数化的3D高斯,锚定在中性头部模板上。这种UV表示将3D高斯的数量与后续处理解耦。

DSplats则聚焦基于去噪的多视角扩散模型进行3D生成。现有基于高斯的3D重建技术已能从稀疏输入图像中以前馈方式预测3D高斯,取得高保真效果,但往往缺少扩散模型所提供的大规模先验与表达能力。DSplats的研究方向正是弥补这一不足。

技术路线差异与共同趋势

三项工作分别对应单图生成、多视图重建与扩散先验三条路径。Luce强调材质感知与可重光照,HeadsUp强调UV参数化与可扩展性,DSplats强调扩散先验的表达能力。三者共同指向一个趋势:3D生成正从单纯几何还原,转向几何、材质、光照与语义细节的协同建模。

对需要把生成资产接入真实渲染管线的团队来说,物理渲染属性的引入是关键一步。Luce在FID和CLIP对齐分数上的提升,说明材质与几何的统一表示不只是工程上的便利,也直接影响生成质量。