当前,3D场景生成正从单图或文本驱动的物体生成,拓展至可自由浏览与编辑的大规模空间环境。与纯文本条件相比,几何条件能直接指定结构、物体位置与布局,更适用于虚拟现实、游戏、仿真、机器人及自动驾驶等可控3D应用。现有几何条件方法通常采用三阶段流程:先定义相机视点或轨迹,再沿此生成多视图图像,最后重建NeRF或3DGS表示。但在室外场景中,输入几何往往大、稀疏、开放且无固定边界,人工指定相机轨迹既繁琐,也很难兼顾覆盖率和生成稳定性

针对此问题,POSTECH与Meta Reality Labs合作提出SceneFrom3D。SceneFrom3D是一种面向室外几何条件 3D 场景生成的自动视角调度框架,将输入物体几何转化为有向生成图,并进一步引入目标级外观图像和几何遵循参数,从而在无需显式相机轨迹的情况下生成可控 3DGS 场景。实验结果表明,SceneFrom3D 在 UrbanArchitect、YoNoSplat 和无人机路径规划式视角调度基线之上取得了更好的视觉质量和结构一致性。

打开网易新闻 查看精彩图片

论文题目:
SceneFrom3D: Geometry-Conditioned Outdoor 3D Scene Generation via View Scheduling with Object-Level Control
文章链接:
https://arxiv.org/abs/2607.04540
项目主页:
https://kimgeonung.github.io/SceneFrom3D

一、研究背景

3D场景生成旨在构建空间一致的三维表示,使用户能够从任意视角渲染和浏览该场景。NeRF[1]与3DGS[2]已经可以实现自由视角渲染,当前学术界研究的焦点正转向可控生成:如何从用户给定的条件生成一个完整、真实且可控的 3D 场景几何条件可以明确物体布局与空间尺度,显著降低生成歧义,从而优于文本或图像条件

打开网易新闻 查看精彩图片

上图展示了本文方法的流程。SceneFrom3D以带属性的物体网格为输入(非相机轨迹),用户可指定外观参考与几何遵循程度,最终输出可任意视角渲染的3DGS场景。针对现有方法,SceneFrom3D主要解决目前的三大瓶颈:

(1)室外调度规则缺失:室内存在边界与稳定的视距,规则布设有效。室外则无界且视距多变,需要人工来指定轨迹

(2)视角平衡困难视图过少导致覆盖不足,过多则成本激增且易引发纹理冲突。调度需在覆盖度和生成稳定性之间寻求平衡。

(3)物体级控制匮乏现有方法大多都是全局结构,难以指定特定物体外观或调节几何贴合度

二、本文方法

本文方法的核心目标是从一组带属性的物体几何中自动生成可训练 3DGS 的多视图观测。设场景中的物体集合为 ,每个物体由几何、外观参考图像和几何系数组成:

其中, 是物体 的输入网格, 是目标外观图像, 表示该物体对输入几何的遵循强度。 越大,生成结果越应贴近结构条件,SceneFrom3D 最终会输出一个 3DGS 场景表示。

打开网易新闻 查看精彩图片

上图展示了 SceneFrom3D 的整体框架。方法首先从输入几何构造有向生成图,图中的节点表示锚点视角,边表示锚点之间的插值轨迹,边方向表示多视图生成顺序。随后,模型沿用 VideoFrom3D[3] 中采用锚点生成和视频插值的策略以图像扩散模型生成关键观测,再以视频扩散模型沿图边补全中间视角,全程无需外部轨迹。最后,所有生成图像与几何渲染的深度图共同监督3DGS优化。

2.1 用可见性构造稳定的锚点视角

SceneFrom3D 将视角调度表示为有向生成图:

其中, 是锚点视角集合, 是有向插值边集合。构造该图的关键,是先找到一组既能覆盖输入几何、又不会过密的锚点视角。为此,作者从输入网格表面采样点,并定义锚点视角 对表面点 的可见性:

对每个表面点,作者进一步用并集聚合所有锚点视角的覆盖情况:

基于该指标,SceneFrom3D 从空视角集合开始,反复选择覆盖不足的表面区域并放置新相机,再通过删除低贡献相机、合并高重叠相机和重新补充未覆盖区域,得到紧凑的初始化视角集合。

打开网易新闻 查看精彩图片

如上图所示,初始化后还需要优化相机姿态。优化目标由覆盖损失、相机与网格的排斥损失以及正则项共同组成

在节点确定后,SceneFrom3D 会连接具有足够共享可见性且相机运动无碰撞的锚点对。每条边对应一条平滑插值轨迹,用于后续视频扩散补全中间视角

2.2 以目标级条件生成锚点图像和插值视角

在有向生成图上,多视图生成分为两步:先锚点生成,后插值补全。对锚点视角 ,构造条件输入:

其中, 为父视角 warp 而来的部分观测及掩码, 为结构条件及腐蚀强度图, 将物体外观参考图与当前视角的可见区域绑定, 为文本提示。

打开网易新闻 查看精彩图片

如上图所示,几何遵循参数 通过腐蚀强度 控制: 较大时,深度结构扰动小,生成更贴合几何。 较小时,结构噪声增多,模型可在保持大致形状的同时生成更自由的外观细节

2.3 用生成图像和几何深度共同优化 3DGS

最后,SceneFrom3D 将所有生成的有位姿图像作为训练视图,优化一个 3DGS 表示。对于每个生成视角 ,设 为生成 RGB 图像, 为从输入网格同一相机位姿渲染得到的深度信息,优化目标为:

其中, 和 是当前 3DGS 渲染得到的 RGB 与深度。RGB、DSSIM 和 LPIPS 项使 3DGS 拟合生成图像的外观,深度项则将高斯点约束回输入几何附近

三、实验结果

作者构建了包含9种室外场景布局的测试数据集,物体数量从9到16不等,每种布局生成10个不同场景用于对比。测试时,以锚点视角为控制点生成贝塞尔曲线轨迹,得到约400至700张不重叠的测试帧。对比方法包括三类基线:UrbanArchitect(基于SDS优化)、YoNoSplat(前馈重建)以及基于无人机的路径规划方法(作为视角调度基线)。评估指标涵盖视觉质量(CLIP Aesthetic、MUSIQ)和结构保真度(尺度不变PSNR-D、Chamfer Distance及阈值为0.1的F-score),从多维度衡量生成场景的视觉效果与几何一致性。

3.1 定性实验结果

打开网易新闻 查看精彩图片

上图展示了 SceneFrom3D 与不同基线的定性对比。其中基于无人机路径的规划方法非常容易生成俯视轨迹,其视角偏离典型眼平高度,导致扩散生成质量下降。UrbanArchitect 则依赖 SDS 优化,结果模糊且纹理不稳定。YoNoSplat 虽然可以用生成视图进行前馈重建,但它主要面向真实场景中捕获的图像,在生成视图和大规模室外场景上存在域差异。相比之下,SceneFrom3D通过自动视角调度与物体级条件控制,在保持输入几何布局的同时生成清晰、逼真的多视角观测,验证了其在复杂室外场景中的有效性。

3.2 定量实验结果

打开网易新闻 查看精彩图片

上表显示了完整 SceneFrom3D 在 CLIP Aesthetic、PSNR-D、Chamfer Distance 和 F-score 上均取得最佳结果。相比之下,UrbanArchitect 的 Chamfer Distance 高达 264.265,F-score 仅为 0.00001,说明其结构重建与输入几何偏离明显。YoNoSplat 的 Chamfer Distance 为 46.664,基于无人机路径的视角调度方案为 39.173,也明显落后于完整模型。SceneFrom3D 的优势不只体现在单视角视觉质量上,更体现在生成的 3DGS 能更稳定地保持输入几何结构。

3.3 不同几何参数的影响

打开网易新闻 查看精彩图片

上图展示了几何遵循参数 的作用。在同一个具有精细结构的房屋几何上,当 时,生成结果会更严格贴合输入结构图,屋顶老虎窗、门窗位置等局部几何细节都被较好保留。当 时,模型仍然能够保持房屋的大体形状,但局部细节可以更自由地变化,生成外观不再被精细几何强约束。这验证了 SceneFrom3D 的目标级控制不仅是给每个物体一张参考图,还包括对每个物体结构约束强度的连续调节。

3.4 算法效率分析

打开网易新闻 查看精彩图片

上表进一步展示了本文方法在不同布局下的场景规模和运行时间。实验使用 NVIDIA A100-80G GPU,视角调度和 3DGS 训练各使用单卡,多视图生成使用两张 GPU 并行推理。不同布局包含 4 到 21 个锚点节点、4 到 22 条插值边,并生成 200 到 1099 个训练视图。完整流程总耗时约 86.8 到 426.7 分钟,其中多视图生成阶段占主要开销。例如 Village 场景总耗时 360.6 分钟,其中多视图生成耗时 316.8 分钟,而 3DGS 训练耗时 39.7 分钟。实验结果表明 SceneFrom3D 当前更适合作为离线 3D 内容生成框架,而不是实时生成系统。其算法瓶颈已经从视角规划和 3DGS 优化,转移到高质量图像扩散与视频扩散推理本身。若后续图像和视频生成模型进一步加速,SceneFrom3D 的端到端效率也会随之改善。

四、总结

本文提出的 SceneFrom3D,是一个面向室外几何条件 3D 场景生成的自动视角调度框架。它将输入几何转化为有向生成图,并推导覆盖充分且紧凑的锚点视角,并结合物体级外观参考与几何遵循参数 实现从严格贴合几何到宽松形状引导的连续控制。多视图生成阶段沿图展开,锚点由微调扩散模型生成,中间帧由视频扩散模型插值补全,最终共同监督3DGS优化。实验表明其在视觉质量与结构一致性上显著优于UrbanArchitect、YoNoSplat等基线,把室外 3D 场景生成中的相机轨迹设计问题,转化为一个由几何驱动的生成图构造问题。

参考

[1] Mildenhall B, Srinivasan P P, Tancik M, et al. Nerf: Representing scenes as neural radiance fields for view synthesis[J]. Communications of the ACM, 2021, 65(1): 99-106.

[2] Kerbl B, Kopanas G, Leimkühler T, et al. 3d gaussian splatting for real-time radiance field rendering[J]. ACM Trans. Graph., 2023, 42(4): 139:1-139:14.

[3] Kim G, Han J, Cho S. Videofrom3d: 3d scene video generation via complementary image and video diffusion models[C]//Proceedings of the SIGGRAPH Asia 2025 Conference Papers. 2025: 1-11.

Illustration From IconScout By IconScout Store

9月28日晚@美国匹兹堡

「IROS 2026 群星闪耀 精英晚宴」

免费报名,期待线下见面!

北京时间9月25日(周五) 12:00截止报名

-The End-

本周上新!

扫码观看!

“AI技术流”原创投稿计划

TechBeat是由将门创投建立的AI学习社区(www.techbeat.net)。社区上线700+期talk视频,3000+篇技术干货文章,方向覆盖CV/NLP/ML/Robotis等;每月定期举办顶会及其他线上交流活动,不定期举办技术人线下聚会交流活动。我们正在努力成为AI人才喜爱的高质量、知识型交流平台,希望为AI人才打造更专业的服务和体验,加速并陪伴其成长。

投稿内容

// 最新技术解读/系统性知识分享 //

// 前沿资讯解说/心得经历讲述 //

投稿须知

稿件需要为原创文章,并标明作者信息。

我们会选择部分在深度技术解析及科研心得方向,对用户启发更大的文章,做原创性内容奖励

投稿方式

发送邮件到

yimingzhang@thejiangmen.com

添加工作人员微信(aceyiming投稿,沟通投稿详情

关于我“门”

将门是一家以专注于数智核心科技领域新型创投机构,也是北京市标杆型孵化器。 公司致力于通过连接技术与商业,发掘和培育具有全球影响力的科技创新企业,推动企业创新发展与产业升级。

将门成立于2015年底,创始团队由微软创投在中国的创始团队原班人马构建而成,曾为微软优选和深度孵化了126家创新的技术型创业公司。

如果您是技术领域的初创企业,不仅想获得投资,还希望获得一系列持续性、有价值的投后服务,欢迎发送或者推荐项目给我“门”:

bp@thejiangmen.com

打开网易新闻 查看精彩图片

点击右上角,把文章分享到朋友圈