TUM 教授 Angela Dai:放下完美数据执念,「逆向自监督」重构 3D 空间智能 | ECCV 2026
雷峰网
·北京·雷锋网官方网易号
打开网易新闻 查看精彩图片
2D去噪范式在真实3D遮挡前失效,破局关键在于将物理机制转化为结构先验。
作者丨张璐
编辑丨岑峰
大模型在文本与 2D 图像上的狂飙,归功于互联网上近乎无穷的干净数据。但当 AI 试图跨越屏幕、理解真实的 3D 物理世界时,这套经验法则瞬间失效。真实扫描数据充斥着噪点与死角,物理遮挡造成的几何缺失既非随机发生,更无法用简单的去噪算法抹平。面对这一死结,多数团队选择用人工合成数据去“硬碰硬”,却始终难以跨越虚实结合的鸿沟。在 ECCV 现场,慕尼黑工业大学(TUM)Angela Dai 教授展示了一套逆转行业思路的解法:不必强行克服数据的“不完整”,把真实的物理遮挡机制,直接变成算法的结构先验。
打开网易新闻 查看精彩图片
这项研究不仅打破了 3D 场景重建中困扰已久的“均值模糊”魔咒,更清晰地标定了空间智能(Spatial AI)从“静态 3D 拼图”走向“原生具身大脑”的技术演进路线。整套破局逻辑由三个层层递进的技术支柱构成:第一,将物理遮挡转化为逆向自监督(SG-NN)。团队先是将传感器的视野拆解为已知空域、已观测表面与未知盲区的三状态编码。团队摒弃对盲区的盲目强行预测,通过故意扣除观测帧构建训练对,用掩码损失(Mask Loss)让物理遮挡本身成为最天然的自监督标靶。 第二,用“几何骨架 + 2D 渲染”破解均值模糊(Seen2Scene)。面对大面积盲区带来的严重歧义,引入可见性引导的流匹配(Seen2Scene)与 3D 高斯溅射(WorldMesh)。由稳定几何提供不漂移、不坍塌的“骨架”,再借由 2D 图像先验反哺高保真“皮肉”,首次将连贯生成的尺度拉伸到了七八个房间的环境级空间。 第三,从生成反哺重构,走向机器人的“主动感知”(GenRecon):将合成场景学到的结构先验反向注入真实重构(GenRecon),更顺理成章地将物理可见性推演至具身智能领域。让 AI 不再是被动接收残缺图像的画师,而是能够预判未观测空间、自主规划最佳探路路径的空间智能体。
打开网易新闻 查看精彩图片
以下为演讲全文,雷峰网AI科技评论在不改变原意的基础上,对内容进行了整理与编辑:
打开网易新闻 查看精彩图片
01
数据天然“残缺”:为什么 2D 扩散范式在 3D 空间彻底失效? 文本和图像生成的爆发,本质上建立在互联网海量公开数据的红利之上。无论是能侃侃而谈的大语言模型,还是瞬间绘图的生成算法,背后都有庞大的文本文献、艺术作品和照片库作为支撑。
打开网易新闻 查看精彩图片
然而,当人工智能尝试踏入物理空间去生成 3D 场景时,这种基于海量数据的经验法则迅速失效了。现实环境不仅杂乱且充斥着传感器噪声,更难以克服的是物体相互遮挡带来的视角盲区。
如果退而求其次使用人工构建的合成场景,模型虽然能获得完整的几何结构,却又会因为缺失现实生活的随机布局与复杂杂乱感,陷入“合成与现实”之间难以跨越的鸿沟。在最新的研讨会分享中,她给出了一个兼具工程美感与物理直觉的解法:不再强行克服数据的“不完整”,而是直接引入空间本身的物理原则,让 AI 学会利用已知的空无与遮挡关系,主动在残缺的观测中推演完整的现实。
打开网易新闻 查看精彩图片
02
把遮挡变先验:用“已知空无”推演未知的物理结构 要打破 3D 数据采集的天然缺陷,首要突破在于将物理相机的观测机制转化为算法能理解的几何先验。当深度传感器观测一个场景时,它不仅捕捉到了物体的表面,还隐性地界定出了三类空间状态:在传感器与表面之间,是确定的已知空域;表面本身是已观测几何;而被表面遮挡的后方,则是状态未知的未观测区域。
别长距离漂移:基于几何骨架与 3DGS 的全景长图渲染 为了解决大面积几何缺失带来的歧义,生成式扩散模型被引入到了 3D 场景重建中。
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
在获得了高质量的几何“骨架”之后,场景的外观“皮肉”合成展现出了更高的自由度。
打开网易新闻 查看精彩图片
虽然单纯依赖大语言模型安排布局容易显得僵硬人工,但成熟的 2D 图像生成模型却天然具备生成逼真且富含生活杂乱感画面的能力。算法先生成基础几何,随后借助图像模型跨视角采样并合成具有丰富纹理的图像,再将这些像素反向提取回网格。最终,整个场景由 3D 高斯(3DGS)技术进行全局优化,并利用基础网格进行几何正则化,从而在稀疏视角的输入下依然能保持极高的画面质量与视角一致性。
站在更长远的视角来看,空间 AI 的终局在于几何、外观与语义的深度融合。当前行业普遍将这三者割裂处理,甚至只是把 2D 视觉模型的语义特征简单叠加到 3D 表达之上。真正高效的范式应当是建立原生的 3D 统一大模型,因为在明确知道要生成一张椅子时,几何结构的构建本身就会变得更加容易。不仅如此,物理可见性原则还将推演至机器人的主动探索领域。当 AI 不再是被动接收人类拍到的残缺图像,而是能够主动预测未观测区域的面貌时,它就能自主决定下一个最佳观测位置,从而以最优路径完成复杂空间内的感知与任务交接。
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
05
现场 Q&A:技术边界与落地现实 在 Q&A 环节中,Angela 教授明确指出了当前 3D 生成落地的两大现实边界:一是扩散生成模型繁复采样带来的高延迟问题,二是复杂场景下精度与速度的平衡。这预示着轻量化稀疏体素与局部包围盒(Bounding Box)优化将是工业级部署的关键。
热门跟贴