打开网易新闻 查看精彩图片

从单纯的动作模仿,推进到统一的世界-动作学习

作者丨FutureNav team

编辑丨齐铖湧

当机器人听到一句自然语言指令,例如“沿着楼梯上去,穿过门,在水槽旁停下”,它需要完成的远不止识别物体和预测下一步动作。它必须理解自己在哪里、刚刚经过了什么、当前动作会如何改变所处空间,以及下一刻可能看到怎样的环境。

近日,AI科技评论关注到,来自清华大学、鹏城实验室、香港科技大学(广州)、小米汽车和新加坡国立大学的研究团队提出的FutureNav,在这一领域做出了非常前沿的探索。FutureNav是一个面向连续视觉语言导航(Vision-and-Language Navigation, VLN)的统一 world-action 建模框架

论文题为“FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation”,已发布于 arXiv。

除了方法本身,FutureNav 还有一个工程亮点:模型训练阶段由国产AI加速算力芯片支撑。这意味着 FutureNav 的训练实践不仅展示了世界-动作建模在具身导航中的效果,也体现了国产 AI 算力平台对大规模视觉语言导航模型训练的支撑能力。

论文链接:https://arxiv.org/pdf/2606.30367

项目主页:

https://linglingxiansen.github.io/FutureNav/

代码仓库:

https://github.com/linglingxiansen/FutureNav

01

导航不能只靠“模仿下一步”

打开网易新闻 查看精彩图片

近年来,基于视觉语言模型(VLM)的导航基础模型发展迅速。许多方法将视觉历史和语言指令输入大模型,再让模型直接输出 MOVE_FORWARD、TURN_LEFT、TURN_RIGHT 或 STOP 等低层动作。这种范式简洁高效,但也存在一个关键问题:模型主要学习“从观察到动作”的映射,却缺少对世界状态和状态变化的显式监督。

在连续环境中,这个短板会被放大。机器人需要在长动作序列中保持空间记忆,理解地标、转向、通道、楼梯和目标位置之间的关系,还要避免早期错误不断累积。换句话说,一个可靠的导航智能体不仅要知道“下一步该做什么”,还要知道“执行这个动作后,世界会怎样变化”。

FutureNav 正是围绕这一点展开:把视觉语言导航从单纯的动作模仿,推进到统一的世界-动作学习。

02

四种能力,一个统一框架

打开网易新闻 查看精彩图片

FutureNav 以 VLM 为主干,并引入冻结的空间编码器来提取几何感知特征。语言指令、视觉观测和空间特征被统一送入语言模型,使模型在保留 VLM 语义理解能力的同时,获得更强的空间状态表征。

在训练阶段,FutureNav 同时优化四类目标:

1. 动作策略学习:根据语言指令和视觉历史预测下一步导航动作。

2. 逆动力学建模:根据前后两帧观测变化,反推出中间执行了什么动作。

3. 前向动力学建模:给定当前状态和动作,预测下一步空间状态。

4. 未来状态生成:不显式依赖动作 token,预测短时未来的空间状态。

这四个目标共同约束模型:它不仅学习“要执行什么动作”,也学习“这个动作对应怎样的状态转移”,以及“未来空间可能如何演化”。因此,FutureNav 的训练过程更接近真实导航所需的空间推理过程。

打开网易新闻 查看精彩图片

更重要的是,FutureNav 并没有牺牲推理效率。辅助的动力学和未来预测模块主要用于训练阶段塑造共享表示;在默认推理设置下,模型只保留动作策略分支进行直接动作解码,因此不会引入额外的在线想象、候选轨迹展开或规划成本。

03

4B 模型也能达到领先性能

论文在 R2R-CE 和 RxR-CE 两个标准连续 VLN 基准上进行了系统评测。结果显示,仅使用 4B 规模主干的 FutureNav,就能在多个指标上超过已有更大规模导航模型。

打开网易新闻 查看精彩图片

在完整训练设置下,相较 JanusVLN,FutureNav-4B 在 R2R-CE 上带来SR 提升 8.1%、SPL 提升 7.9%,同时导航误差 NE 相对降低 11.3%。FutureNav-8B 在 RxR-CE 上实现SR 提升 13.7%、SPL 提升 15.4%、nDTW 提升 11.3%,NE 相对降低 29.7%。

这些结果说明,FutureNav 的提升并不只是来自更大的模型或更多数据,而是来自更合理的世界-动作联合建模方式。值得注意的是,使用了国产芯片进行训练。这让 FutureNav 的意义不只停留在算法层面:它同时展示了国产算力平台支撑多模态具身导航模型训练、并产出国际竞争力结果的潜力。

04


不只是最终性能,更提升训练效率

打开网易新闻 查看精彩图片

消融实验进一步验证了 FutureNav 各个组件的作用。在不使用外部导航数据的 0K 设置下,单纯的 policy-only baseline 在 R2R-CE 上取得 50.1 SR / 45.1 SPL;加入全部 world-action 目标后,提升到 55.1 SR / 50.1 SPL,并将 NE 从 6.00 降低到 5.13。

其中,前向动力学、逆动力学和未来状态生成都带来了正向增益,说明这些目标提供的是互补监督,而不是简单重复动作标签。

打开网易新闻 查看精彩图片

论文还比较了不同潜变量表征:VAE latent、VLM visual latent、DINO semantic latent 和 spatial latent。结果显示,FutureNav 使用的空间潜变量效果最好,在 R2R-CE 0K 设置下达到 55.1 SR / 50.1 SPL,明显优于其他 latent 选择。这也印证了一个核心判断:对于具身导航而言,显式建模空间状态比单纯建模视觉外观更关键。

打开网易新闻 查看精彩图片

训练效率方面,FutureNav 在相同训练进度下持续优于 policy-only baseline。论文报告显示,FutureNav 在约 63% 训练进度时就达到 50.2 SR,已经接近 policy-only 模型最终的 SR 水平,体现出 world-action 监督对收敛效率的帮助。

05

从仿真到真实机器人

打开网易新闻 查看精彩图片

除了仿真基准,论文还展示了 FutureNav 的零样本真实环境部署。研究团队将模型部署在 H20 GPU 服务器上,并使用搭载 D435i 相机的 Go2 机器人进行实机导航。机器人接收自然语言指令和第一视角 RGB 观测,由服务器预测低层动作,再在真实室内外环境中执行。

在没有额外真实世界微调的情况下,FutureNav 能够根据可见地标完成导航,并在指定目标附近停止。这表明,训练阶段学到的世界-动作结构不仅提升了仿真指标,也有助于跨外观、光照和布局变化的真实场景泛化。

06

迈向具身导航的未来世界模型

FutureNav 的核心价值在于,它为 VLM 导航模型提供了一种更完整的训练范式:不再只把导航看成“观察到动作”的序列模仿,而是把动作策略、状态转移、逆向动作推断和未来状态预测统一到同一个框架中。

这种设计兼顾了三点:

• 空间理解更强:通过冻结空间编码器和 spatial latent 监督,增强模型对环境结构的感知。

• 动作决策更稳:通过正向/逆向动力学约束,提升动作与状态变化的一致性。

• 推理仍然高效:辅助 world-action 模块主要用于训练,默认推理只走策略分支。

对于视觉语言导航和具身智能研究而言,FutureNav 提供了一个清晰信号:下一代导航模型不能只会“模仿专家动作”,还需要理解动作如何改变世界,并在决策前形成对未来空间状态的内部预期。

FutureNav 正是在这个方向上的一次重要探索。

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。