本文作者 Weijian Chen 时为 Insta360 研究院算法实习生。Lu Qi 为本文通讯作者。
近日,来自 Insta360 研究院的研究人员,联合武汉大学、中山大学等高校科研人员,提出了 PanoLOG—— 首个面向全景输入的大规模户外三维重建工作。依托 Insta360 X5 手持全景相机与 Antigravity A1 全景无人机等设备,他们团队构建了一套全新的 3D 高斯重建方案,并同步开源了首个大规模全景户外重建基准 Pano360。
过去,城市级的三维重建大多依赖大量窄视场照片和分块训练,采集与计算成本都很高。全景相机能够一次拍摄覆盖 360° 视野,本可以显著降低采集成本,但它带来的处处可见特性,又让沿用已久的分区策略失效。
PanoLOG 正是针对这一矛盾提出的:它把大场景重建中的分区判据,从传统的空间可见性转换为梯度贡献,让分块并行训练在全景条件下重新成立。在自建的 Pano360 以及公开的 Ricoh360、360Roam 基准上,PanoLOG 均取得了当前领先的渲染质量,同时保持了更小的模型体积。这项工作也为户外场景的具身智能与世界模型实践,提供了一条新的技术思路。用一句话概括这项工作,那就是:用全景输入,重建一个可感知的物理世界。
代码、模型与 Pano360 数据集逐步开源中。
- GitHub 仓库:https://github.com/Insta360-Research-Team/GGPS
- arXiv 论文:https://arxiv.org/abs/2607.08769
- 项目主页:https://insta360-research-team.github.io/GGPS-Website/
- Hugging Face:https://huggingface.co/Insta360-Research/GGPS
关键问题:全景让采集变简单,
却让分区失效
近年来,新视角合成已经成为计算机视觉的一项基础能力,支撑着从自动驾驶到具身智能的众多应用。3DGS 之所以成为主流范式,是因为它用各向异性的显式高斯基元配合高效的可微光栅化,把照片级重建的渲染速度提到了很高的水平。
但要把 3DGS 铺到城市级、自然风光级的大户外,两项成本立刻凸显出来:
- 采集成本高。 传统流程需要用窄视场(FoV)相机拍摄成千上万张照片,再用分而治之的策略把场景切块。这不仅费人费时,还容易在拼接边界处产生结构不一致。
- 计算开销大。 场景一大,单张显卡的显存装不下,必须切块训练,否则无法完成。
全景 ERP 图像本可以直接缓解第一项成本:一次拍摄覆盖 360° 视野,采集端的人力和时间大幅下降。问题在于,复杂度并没有消失,只是从采集端转移到了分区端,而且形成了一个结构性矛盾。
传统分区方法依赖针孔相机的局部可见性 —— 每块区域只被一部分相机看到,系统才能据此把相机分派给对应的块。而全景相机是 360° 视角,几乎每一台相机都能观测到几乎每一个块。这样一来,基于可见性的分区判据失去了区分度,本应分块进行的优化退化成了高开销的全局优化。
于是问题变成:能不能设计一套专门适配全景图像的分区策略?这正是 PanoLOG 要回答的核心问题,也是把全景真正用于大规模重建的前提。
视频链接:https://mp.weixin.qq.com/s/-rPhko03ekb2xnELKTUJjQ
创新之举:
Two Stage 与 G²PS 方法的实践
PanoLOG 是一个两阶段、由粗到精的框架,核心是 G²PS(即 GGPS)。它的基本思路是:既然处处可见让可见性判据失效,那就不再判断某个区域能否被看到,而是评估每台相机对每个块贡献了多少优化梯度。贡献大的区域参与训练,贡献小、遥远或被遮挡的区域被忽略。这样即便在处处可见的环境下,也能重新建立清晰的相机与区域的分配关系,恢复分块并行训练的计算优势。
阶段一:全局粗训练
如果直接对原始 SfM 点云做分区,会在块外区域留下大量漂浮物,并且由于渲染质量不高,导致相机与块的分派不可靠。因此 PanoLOG 先对所有输入全景做一次全局粗优化,建立稳定的几何先验。与只依赖光度监督的主流框架不同,PanoLOG 率先引入全景单目深度监督,为后续基于梯度的分区提供可靠的几何锚点。这一阶段还包含两项针对户外场景的关键设计:
- 显式天空球。天空区域没有有效的 SfM 几何,会诱使近场高斯向外漂移并产生飞屑。PanoLOG 在半径为场景尺度 10 倍的远处球面上均匀初始化 10 万个专用天空高斯。粗训练时,天空高斯的位置梯度被置零以防漂移,仅优化颜色、旋转、不透明度等外观参数,并且不参与致密化。
- 全景深度监督。ERP 图像的两极区域存在严重的像素拉伸,会降低 SfM 三角化质量,使初始点云稀疏且不可靠。PanoLOG 采用原生支持 ERP 输入的深度模型 DAP 生成单目逆深度图,并按每张图像的仿射参数对齐到 SfM 稀疏深度。深度损失的权重随训练指数衰减,早期提供较强的几何引导,后期平滑过渡到以光度为主的优化,避免深度估计误差影响最终质量。
阶段二:分块精修与 G²PS
G²PS 通过两个互补机制解决全景下的分区问题:基于几何的空间分区,以及基于梯度的相机与块分派。
1. 基于几何的空间分区。
- 无界的户外空间如果直接均匀切网格,会切出大量近乎为空的块,造成负载严重失衡。G²PS 先根据相机分布和三角化可靠性,把场景收缩进一个自适应的轴对齐包围盒(AABB)。具体来说,它先由相机质心和各轴基础半径圈定相机轨迹范围;由于全景场景内容会延伸到相机之外,再依据相邻全景之间的视差不确定性估计有效重建范围,自适应地扩展边界,取代人工设定的固定边界。随后把收缩后的空间均匀切块,得到分布更均衡的高斯。
2. 基于梯度的相机与块分派。
- 阶段一收敛后,PanoLOG 对所有训练视角做一次前向 - 反向传播,统计每台相机对每个块内高斯的平均梯度幅值。相机与块的分派同时考虑几何归属和梯度重要性:一台相机只要几何上落在某个块内,或者它的归一化梯度得分超过阈值(默认 0.8),就会被分派给该块。这样即便某台相机物理上位于相邻块,只要它对该块有显著的观测贡献,也不会被漏掉。
3. 分块优化与合并。
- 每个块都以阶段一得到的完整高斯集合作为初始化,再用分派给它的相机独立优化。天空高斯在此阶段全程冻结,以保持跨块的外观一致。为了自适应地确定每个块的有效空间范围,PanoLOG 借助周期性的不透明度重置:重置后所有场景高斯的不透明度被压到较低值,只有持续收到足够光度梯度的高斯才会恢复高不透明度,其余则保持透明并被剪枝。由于相邻块共享部分重叠的相机集合,块边界附近的高斯能够得到跨边界的一致监督,因此无需显式拼接就能在块交界处得到连贯的几何和外观。
最后,在渲染表示上,PanoLOG 采用 ERP 投影:把三维点的球面坐标映射到像素坐标,并通过 ERP 雅可比把三维协方差投影为二维协方差。与针孔流程不同,这里的二维协方差由非线性的 ERP 雅可比给出,而非透视投影矩阵,从而正确处理 360° 视野。
下图中,无论是全景整体还是局部细节,PanoLOG 都稳定优于四种现有方法。优势最明显的是两类城市场景中的常见难点:远处物体和复杂玻璃幕墙。这两处也最能反映一个重建结果是否经得起走近观察。
PanoLOG 与其他全景重建方法在 ERP 图上的方法对比
领先的行业结果
该文章所有方法统一训练 30,000 步,默认使用两个分区,均在单张 NVIDIA RTX 4090(24GB)上运行。对比对象包括大规模 3DGS 方法 H3DGS、CityGaussian、DOGS、Momentum-GS(把 ERP 转成六面 cubemap 后送入针孔模型);在公开数据集上,还额外对比了全景专用方法 OmniGS、ODGS、SpaGS 以及 cubemap 输入的 3DGS 基线。评价指标为 PSNR、SSIM、LPIPS 和模型体积。
1. Pano360・A1 无人机场景(NSC、NSK)
PanoLOG 在 NSC 上取得最佳的 PSNR、SSIM、LPIPS,同时模型体积最小;在 NSK 上取得最佳的 SSIM 和 LPIPS。
2. Pano360・X5 手持街景(BAX、NSN)
在更难的手持街景上,PanoLOG 的 PSNR 比最强基线在 BAX 上高 0.64 dB、在 NSN 上高 1.16 dB,而模型体积仅为最强基线的 1/2.9 到 1/7.5。作为对比,最强基线 H3DGS 为了扛住场景,模型体积在这两个子集上分别涨到约 7.6GB 和 5.7GB。
3. 公开数据集验证(Ricoh360、360Roam)
为验证泛化性,团队在 Ricoh360 和 360Roam 上对比了全景专用方法。PanoLOG 在两个数据集的 PSNR、SSIM、LPIPS 六项指标上全部取得最优,说明这套全景原生设计并不局限于自建数据。
对三维重建与具身智能行业的展望
PanoLOG 最核心的贡献,是改变了大规模场景重建长期依赖的一个假设:把分区判据从空间可见性转换为梯度贡献。在全景相机下,每张图像几乎覆盖全景,基于可见性的分区框架彻底失效;引入几何与梯度评估后,系统即便在处处可见的环境中,也能重建出清晰的相机与分区关联,使大规模高斯泼溅第一次真正适用于全景数据,也为低成本的城市级三维重建提供了一条新路径。
把视野放到更大的愿景中,这项工作与影石对未来影像的整体判断是一致的。2026 年 7 月,影石在十一周年之际提出了 Cameraman(摄影机器人)的产品愿景:它并非某一款终极产品,也不局限于某一具体形态,而是一个自主拍摄的智能体概念 —— 由 AI 影像系统作为大脑,镜头作为眼睛,音频作为耳朵,云台与无人机作为可活动的躯干,根据不同场景灵活适配最合适的载体,让人们从繁重的器材操作中解放出来,把感官和注意力交还给眼前的瞬间。全景无人机影翎 A1,正是这一愿景的早期雏形之一。
在这样的愿景里,重建可感知的三维世界,是让智能体理解并置身于真实环境的一块基础能力。一个自主拍摄的智能体,先要能感知空间的结构与边界,才能谈得上自主地构图、移动和成片。PanoLOG 所做的,正是把全景相机采集到的现实场景,还原成结构一致、可自由漫游的三维表示。它的价值可以从几个层面来看:
- 面向 C 端用户。它提供了一套轻量、纯视觉的方案,基于影石现有的 X5、A1 等全景模态产品就能采集。他们致力于把户外场景还原成可以在手机端、PC 端拖拽巡游的 360° 场景。
- 面向具身智能。全景重建与具身智能所需的基础工作高度接近,真实且一致的物理世界正是智能体训练与仿真的基础数据。全景无人机在全景拍摄和高密度信息获取上有天然优势。
- 与世界模型互补。高斯重建提供与现实一致的物理世界,视频生成或世界模型提供可发散的未来世界,两者在应用与研究上可以取长补短、协同发展。
作为影石研究院在全景空间智能方向上的一项学术成果,PanoLOG 更像是通往上述愿景的一块技术积木,而非终点。正如影石所描述的,摄影机器人是一条需要持续积累、逐步成形的长期路线;沿着这条路线,让全景影像不仅被记录、更被理解,是一个值得长期投入的方向。
热门跟贴