高德在8月28日发布了一款流式3D重建模型,名字叫ABot-Recon。它最特别的地方,是彻底放弃了传统方案里的长程记忆锚点,只靠最近12帧连续画面,就能实时稳定重建上万帧的3D场景。项目已经在GitHub开源代码与权重,魔搭社区也上线了体验专区。

12帧局部窗口替代长程记忆

打开网易新闻 查看精彩图片

传统流式3D重建依赖长程记忆锚点来维持全局一致,但序列一长,速度会变慢,精度会下降,显存也会暴涨。ABot-Recon走的是另一条路:局部位姿预测加残差优化。它把最近12帧连续画面作为局部上下文窗口,预测局部点云和相对位姿,再通过在线组合与纠偏机制实时校准误差。

这样做的好处是计算复杂度保持恒定,不会因为视频变长就让显存和计算量跟着膨胀。文章里有一句话概括得很直接:让模型走得更远,未必要记得更多。仅看12帧的模型,反而走出了更准、更快、更省的一条路。

精度、速度、显存三项都拿到SOTA

在Oxford Spires长序列基准测试中,ABot-Recon的平均轨迹误差比行业代表方法LingBot-Map降低了40.6%,相对旋转误差低至0.12°,是同类流式方法里的最优水平,比前代SOTA降低约40%。在KITTI-02测试中,它实现了24.45FPS的实时重建,推理速度达到同类方法的1.24倍。

显存占用同样压得很低。峰值显存只有约6.71GB,大约是同类模型的三分之一。消费级显卡GTX 1080Ti就能跑起来,而且只需要单目RGB视频输入,不需要额外传感器数据。

面向测绘、自动驾驶和具身智能

高德把ABot-Recon定位在几个具体场景里:测绘私域建图、具身智能、自动驾驶和3D内容生产。这些方向对实时性和硬件成本都很敏感,一个能在消费级显卡上跑万帧级重建的模型,意味着部署门槛会低很多。

目前开源的内容包括推理代码、评测代码和权重。对开发者来说,可以直接在GitHub上拿到完整实现,也可以在魔搭社区体验效果。从技术路径看,ABot-Recon用局部窗口加残差优化的方式,绕开了长序列重建里最棘手的记忆膨胀问题,给流式3D重建提供了一个新的解法。