打开网易新闻 查看精彩图片

首次将几何归纳MoE引入3D空间推理 × 分钟级4D GS训练同步突破

编辑丨张璐

ECCV(European Conference on Computer Vision,欧洲计算机视觉大会)是计算机视觉领域具有重要影响力的国际学术会议之一,与CVPR,ICCV并称为全球计算机视觉三大顶会。

打开网易新闻 查看精彩图片

中科煜坤团队ECCV 2026两篇投稿全部录用,实现“两投两中”。两篇论文分别围绕3D空间推理4D动态场景重建展开,覆盖时空智能、动态场景建模、多模态感知、空间理解与具身智能等前沿技术方向。

两项研究它们分别对应中科煜坤时空智能技术体系中的关键环节:一方面,首次基于混合专家模型实现了任务驱动的多模态大模型三维空间推理;另一方面,快速高保真4D重建能力形成了可训练、可仿真、可复用的真实动态世界数据基础。

两篇论文共同指向一个核心问题:当机器人走向真实物理场景时,如何让机器人不只“看见”图像,而是能够理解、重建、推理和交互三维动态世界。

01

为什么时空智能是物理AI发展的关键方向

过去几年,多模态大模型在图像识别、视频理解、视觉问答等任务上取得快速进展。但对机器人和具身智能来说,“看懂图片”还远远不够。

真实世界是三维的、动态的、连续变化的。机器人要在开放环境中移动和作业,需要理解目标在哪里、距离多远、路线怎么走、障碍如何变化、动作是否安全;机器人要与空间交互,需要把图像、语义、几何、时间变化和人的意图统一到同一个时空基准下。

中科煜坤长期围绕感知硬件-空间理解-状态预测-行动决策-数据闭环构建全栈时空智能技术体系,致力于让 AI 具备对三维空间结构、动态变化、人类指令和行动约束的综合理解能力。

本次入选ECCV 2026的两项研究,正是这一技术路线中的两个重要支点:Minute4D负责更高效地构建4D动态空间,SpaR3D-MoE负责更可靠地理解和推理三维空间。

02

论文一:SpaR3D-MoE让多模态大模型

从稀疏视角进行 3D 空间推理

打开网易新闻 查看精彩图片

SpaR3D-MoE旨在从稀疏RGB视角中筛选具有空间拓扑代表性的关键帧,并通过MoE动态融合视觉语义与隐式3D几何特征,从而支撑距离估计、方向判断和路径规划等3D空间推理任务,实现精准可靠的3D空间理解与推理。

当前多模态大语言模型已经能够处理图像和视频,但当任务进入三维物理世界时,模型仍然容易遇到瓶颈。模型可能能识别“门”“桌子”“垃圾桶”,却难以稳定判断它们相对于观察者的位置、距离、方向,或者规划一条合理路线。

已有3D-aware多模态模型大致有两类路线:一类依赖点云、深度图、重建网格等显式 3D 数据,虽然具备较强几何表达能力,但数据获取和处理成本较高;另一类仅使用 RGB 序列,具备更好的适用性,但通常采用拓扑无感知的抽帧策略和静态单一路径融合,容易在稀疏输入下削弱连续场景的空间连通性,同时难以根据不同任务需求动态协调视觉语义与几何线索。

SpaR3D-MoE要解决的问题是:能否在仅依赖稀疏RGB视角的条件下,让多模态大模型既保留关键空间拓扑,又能自适应不同空间任务需求,建立更可靠的三维空间推理能力?

方法亮点:自适应选择关键视角,动态组织推理路径

自适应时空流形采样ASMS

该模块不再简单按时间均匀抽帧,而是结合相机位移、隐式几何变化、时间关系和画面质量构建时空图,在有限帧数预算下优先选择具有空间拓扑代表性和视觉信息量的关键帧。

在压缩长视频输入的同时,尽量保留连续场景中的关键过渡视角和空间连通关系,为方向判断、距离估计和路径规划等任务提供更稳定的时空上下文。

打开网易新闻 查看精彩图片

几何归纳混合专家HGI-MoE

SpaR3D-MoE首次将MoE架构引入3D空间推理,通过指令-位姿感知路由器,根据语言任务意图、视觉特征、隐式3D几何特征和相机位姿信息,动态调度不同的专家分支。

不同专家分别承担视觉-几何对齐、位姿条件下的几何适配、重力方向与结构参考建模等功能,使模型能够针对不同空间任务采用差异化的融合与推理路径,而不是将所有模态信息固定地进行一次浅层融合。

打开网易新闻 查看精彩图片

结果:在多个空间推理基准上取得领先表现

论文在 VSI-Bench、ScanQA 和 SQA3D 等空间理解与三维问答基准上进行了系统评估。

在 VSI-Bench 上,SpaR3D-MoE 取得63.5的平均分,超过最强基线 Qwen3VL-8B7.8个绝对点;在Route Plan和Relative Direction任务上分别取得35.4%和51.4%的相对提升。

值得注意的是,该方法仅使用32个非均匀采样稀疏帧,即可取得优于多类强基线的表现。

在ScanQA validation上,SpaR3D-MoE在video-input模型中达到EM@130.4、CIDEr101.5;在 SQA3D test 上,在video-input模型中达到平均EM@158.3

在室内场景的路径规划任务中,基线模型容易受当前画面中局部可见区域影响,将右侧门框误判为前进方向;SpaR3D-MoE则能够结合自我视角、相机运动和空间拓扑关系,判断目标实际位于当前朝向后方,并给出正确的“Turn Back”。

打开网易新闻 查看精彩图片

在真实实验室场景中,SpaR3D-MoE能够将红门、LED屏、标定板等视觉线索与相机位姿和空间结构关联起来,在统一的物理参考系下完成相对方向判断。

整体来看,SpaR3D-MoE不仅在多个空间推理基准上取得领先表现,也在真实室内场景中展现出较好的空间泛化能力。它能够联合建模空间拓扑、观察者视角和任务意图,为稀疏RGB输入下的现实场景3D空间推理提供了更稳健的技术路径。

打开网易新闻 查看精彩图片

SpaR3D-MoE的价值不只在于提升空间推理基准上的性能,更在于为稀疏RGB 输入下的三维空间理解提供了一种可扩展的技术路径。

它通过关键视角选择保留场景的空间拓扑关系,并通过几何归纳MoE根据任务需求动态融合视觉语义、隐式几何和相机位姿信息,使多模态大模型能够更稳定地完成方向判断、距离估计和路径规划等物理空间推理任务。

对于机器人导航、空间问答、开放场景理解和具身智能交互而言,这类能力意味着模型不再只是识别画面中的物体,而是进一步理解物体与观察者、环境结构和行动目标之间的空间关系。

它对应中科煜坤时空智能技术体系中的关键环节:将二维视觉观察转化为可定位、可关联、可推理的三维空间认知。

03

论文二:Minute4D,让一段普通单目视频

在一分钟内变成高保真4D动态场景

打开网易新闻 查看精彩图片

Minute4D旨在从无标定单目视频中高效重建4D动态场景,通过视觉基础模型增强几何初始化与损失引导密度控制优化高斯表示,从而支撑实时新视角合成和动态空间数据复用,实现分钟级高保真4D动态场景模型训练。

相比静态3D重建,动态场景反映了真实世界:人会移动,物体会遮挡,视角会变化,场景结构会随时间演化。

但在未标定的单目视频中重建动态场景并不容易。相机在动,物体也在动,模型需要区分相机运动和物体运动;动态物体会产生遮挡,导致局部几何缺失;传统优化流程还可能需要较长时间,影响大规模数据构建和实际应用。

Minute4D 的目标是:在保持高保真动态重建质量的同时,把 4D Gaussian Splatting 的优化时间压缩到一分钟级。

方法亮点:更完整的动态几何初始化,更高效的高斯密度控制

Minute4D 的方法框架包含两个核心设计:

结合分割与跟踪先验的点云增强模块(Segmentation-Tracking Enhancement)

首先,利用MegaSaM估计相机参数、深度图和运动概率图,得到初始点云;再用SAM2细化动态物体mask,并通过TAPIP3D进行3D点跟踪,补全动态物体在某些帧中被遮挡、但在其他帧中可见的区域。这样可以获得更完整、更准确的动态几何初始化。

基于时间加权的损失引导密度控制策略(Loss-Guided Density Control)

在4D Gaussian优化过程中,Minute4D根据多视角光度误差图和时间权重,根据时间加权的多视角误差智能分配计算资源,对高斯点进行增密或剪枝,从而减少冗余高斯球,显著降低训练时间和显存开销。

打开网易新闻 查看精彩图片

结果:更快、更省显存,更高重建质量

Minute4D可将典型400帧视频的4D高斯训练时间降低到约40秒,实现至少5倍加速。

在Dycheck iPhone数据集上,Minute4D 在每个场景上都取得最高PSNR(峰值信噪比)指标,平均PSNR达到25.77,相比领先基线提升1.25dB;平均训练时间为0.008 小时,峰值显存1.0GB

在NVIDIA Dynamic数据集上,Minute4D取得24.73dB,训练时间仅0.006 小时,渲染速度达到1218 FPS

消融实验进一步验证了两个模块的互补作用:去除Segmentation-Tracking Enhancement模块会带来动态物体空洞和伪影;去除Loss-Guided Density Control策略后,运行时间从29.224 秒增至397.732 秒,显存从1088MB增至9406MB

打开网易新闻 查看精彩图片

对于时空智能来说,动态场景重建是数据基础设施问题。机器人自学习、仿真训练和开放世界感知,都需要高质量、可复用、可交互的三维动态空间表示。

Minute4D通过更快的4D动态场景构建能力,为动态空间理解、世界模型训练和具身智能仿真提供了重要支撑。

04

SpaR3D-MoE和Minute4D,

共同支撑时空智能

Minute4D解决的是“如何快速构建动态三维世界”,SpaR3D-MoE解决的是“如何让模型真正理解这个三维世界”。

Minute4D面向空间生成与重建。它将单目视频转化为高保真4DGS场景,让真实世界的动态变化能够被高效建模、渲染和复用。

SpaR3D-MoE面向时空理解与推理。它让多模态大模型从稀疏视角中提取关键时空线索,并结合几何、位姿、时间关系和语言指令完成三维空间推理。

两者共同构成时空智能中的关键闭环。先高效构建动态空间,再可靠理解动态空间;先获得真实世界的时空数据基础,再让模型具备面向任务的空间推理能力。

这也对应中科煜坤长期推进的时空智能技术路线:从高质量时空数据、空间几何、多模态推理,到世界模型和行动决策,逐步打通机器人走向真实物理世界所需的核心能力链条。

05

中科煜坤:让时空智能从论文走进物理世界

从4D高斯场景的分钟级训练,到国际首次将混合专家模型引入到空间推理领域,中科煜坤此次ECCV 2026 两篇论文全部录用,是团队在时空智能方向持续探索的阶段性成果。

未来,中科煜坤将继续围绕“感知空间,推理世界”的技术愿景,推进时空数据构建、三维空间理解、世界模型和行动决策等关键技术研发,推动时空智能从学术前沿走向真实物理世界,为机器人和智能设备的开放场景感知等方向提供更加坚实的技术支撑。

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。