近年来,3D 内容生成因其在VR/AR 和具身智能(embodied AI)中的应用而备受关注。上海交通大学提出了SceneGen,这是一个新颖的框架,能够从单张场景图像及其对应的目标掩码中,同时生成带有几何结构与纹理的多个 3D 资产。与依赖优化或资产检索的传统方法不同,SceneGen 实现了一次前向传播即可完成生成,并在特征提取过程中引入了局部与全局场景信息的聚合模块,结合位置预测头(position head),能够同时预测 3D 资产及其相对空间位置。(链接在文章底部)

SceneGen 在生成效率与稳健性上均优于现有方法。特别是在纹理生成与泛化能力方面,SceneGen 相较依赖规范化表示(canonical representations)的方案表现更为出色。这一范式为高质量 3D 内容生成提供了新的解决思路,并展示了在下游任务中具有广阔的应用潜力。此外,尽管仅在单图像输入上进行训练,SceneGen 的架构设计使其在多图像输入场景中表现更佳,展现出良好的可扩展性。

01 技术原理

SceneGen 以包含多个物体的单张场景图像及其对应的分割掩码作为输入。首先,一个预训练的局部注意力模块对每个资产的纹理进行细化;随后,提出的全局注意力模块融合了由专门的视觉编码器和几何编码器提取的资产级与场景级特征;最后,两个现成的结构解码器以及设计的位置预测头(position head)将这些潜在特征解码为多个具有几何结构、纹理和相对空间位置的 3D 资产。

3D 场景生成:(a)现有方法通常需要先从场景图像中分割目标对象;(b)两阶段方法(如 CAST)会依次检索或生成单个资产,再通过后处理进行组装;(c)MIDI 等方法能够直接从单张图像生成多个资产,但容易出现细节模糊和空间布局不合理的问题;(d)相比之下,SceneGen可以在一次前向传播中联合生成多个资产的几何结构、纹理和空间位置,从而生成合理的 3D 场景。

SceneGen能够生成物理上合理的 3D 场景,具有结构完整、纹理细致、空间关系精准的特点。在合成数据集与真实数据集上的实验结果显示,SceneGen 在几何精度和视觉质量方面均显著优于以往方法。

尽管如此,SceneGen 仍存在一定的局限性。由于训练数据分布相对集中,其在非室内场景中的泛化能力受到限制,难以直接拓展到更复杂或多样化的环境。同时,作为单阶段框架,SceneGen 尚未显式建模物体间的空间与物理约束,因此在部分情况下会出现资产重叠或几何不一致的问题。

https://arxiv.org/pdf/2508.15769
https://github.com/Mengmouxu/SceneGen