智猩猩AI整理
长虹具身科技 投稿
让机器人真正理解人的意图,在陌生环境中找到目标,并安全、稳定地抵达那里。
当我们说“帮我把快递送到书房门口”时,这句话对人类来说非常自然,对机器人却意味着一条完整而复杂的推理与执行链路:它需要理解任务、识别环境、确定目标位置、规划可行路径、避开障碍,并把轨迹转化为底层控制指令。更重要的是,真实世界持续变化,任何一个环节都必须根据新的观察不断修正。
因此,我们所关注的并不只是某个单一导航模型,而是一套视觉驱动的通用导航系统:以视觉作为主要环境入口,以 Agent VLM 作为任务级智能核心,以语义落地连接语言与几何世界,再由高频局部导航、状态估计和运动控制共同完成闭环执行。
这也是我们开展视觉导航研究时始终围绕的主线:
让高层智能负责理解和决策,让专业导航模块负责几何、安全与执行;通过清晰的接口和不同时间尺度,把它们组合成一个可持续进化的系统。
01
为什么导航不能只依赖一个“大模型”
视觉语言模型正在快速提升机器人理解开放世界任务的能力。它可以理解“把快递送到书房门口”“找到书房”“从桌子右侧绕过去”等语义,也可以结合历史信息进行长程推理。然而,从理解一句话到安全控制机器人,中间仍然存在明显的能力鸿沟。
一方面,高层任务推理通常以较低频率发生。机器人不需要每几十毫秒重新思考一次“最终要去哪里”,但需要根据任务进度判断下一步目标、发现失败并重新规划。
另一方面,局部避障和轨迹执行必须高频运行。桌椅边缘、狭窄通道、突然进入视野的障碍,以及机器人自身速度和姿态的变化,都要求系统及时响应。仅靠低频语义推理,难以满足几何精度、实时性和安全性的要求。
因此,我们更倾向于构建一个分层、分频、闭环的导航系统,而不是让单一模型同时承担语义理解、空间定位、轨迹规划和运动控制的全部职责。
02
五层架构:从任务意图到机器人运动
我们的整体架构由五个相互连接的层级组成。
1. Agent VLM:导航系统的智能大脑
Agent VLM 面向用户任务和长期目标工作。它接收用户指令、视觉观察、导航记忆、执行历史、地图先验和机器人状态,完成任务理解与拆解、记忆检索、长程规划、策略决策、结果评估和失败恢复。
这一层回答的是:
用户真正想让机器人完成什么?
当前应该先去哪里、做什么?
任务是否正在按预期推进?
遇到死路、目标缺失或执行失败时,应该如何调整?
它输出的不是电机指令,而是结构化的Navigation Intent。例如,“把快递送到书房门口”可以被拆解为确认快递、前往书房、抵达门口等一系列能够被下游模块处理的阶段性导航意图。
2. VLN Grounding:把语义变成几何目标
高层意图仍然是抽象的。VLN Grounding 层负责把语言中的目标和环境中的视觉实体对应起来,将“书房门口”“沿右侧通道前进”等语义描述转化为机器人可执行的几何目标。
这一层结合环境语义感知、模糊指令理解和视觉目标定位,输出带有置信度的 Pixel Goal、Point Goal 或目标嵌入。它所解决的核心问题是:
目标在当前视觉世界中的什么位置?
将语义推理与几何执行分开,可以让上层保持开放世界理解能力,同时让下层获得稳定、明确、可验证的目标接口。
从能力演进的角度看,VLN Grounding 也可以被理解为当前阶段对 VLM导航垂域能力的一次显式拆分:当通用 VLM 还不能稳定地将复杂指令落到精确、可执行的空间目标时,专门的 Grounding 模块可以提供更可靠的语义—几何接口。随着 VLM 的空间理解、视觉定位和导航推理能力持续提升,这部分能力将逐渐由更强的 VLM 原生承担,系统不一定还需要单独训练一个语义 Grounding 模型。
3. VN:面向安全执行的高频局部导航
Visual Navigation Policy / Local Planner 是系统中的高频规划层。它根据当前视觉观察、局部几何、导航目标和机器人状态,持续生成未来一小段可执行轨迹。
这一层需要同时处理四件事:
理解当前局部三维结构;
判断哪些区域可通行、哪些区域存在碰撞风险;
生成朝向目标的连续轨迹;
评估轨迹的安全性和可行性。
它回答的是:
在当前局部环境中,怎样安全地向目标前进?
VN 接收的目标可以是 Pixel Goal、Point Goal 或其他紧凑目标表示。上层 VLN Grounding 或 Agent 不必直接生成完整路径,只需告诉 VN 当前要到达哪里;VN 则结合实时观察,将目标转化为安全、连续的局部轨迹。这样的接口既降低了上层语义模型的执行负担,也让局部规划能够独立围绕实时性、安全性和泛化能力持续优化。
我们在这一层开展的 OccPlanner 工作,是对目标感知、基于 occupancy(空间占用状态)的局部规划的一次具体探索,相关方法与实验将在后文单独介绍。
这里有一个重要的系统取舍:即使系统包含建图模块,局部轨迹仍然主要由 VN 根据实时视觉观察生成,而不是直接在全局地图上机械执行一条固定路线。地图负责提供长期空间关系和粗粒度先验,VN 则负责回答眼前这一步到底应该怎样走。
这种设计带来两方面优势。首先,当机器人进入从未见过的新环境,或现场出现移动物体、临时堆放物和道路阻塞等突发变化时,VN 可以依据最新观察及时重规划。其次,局部规划不强依赖厘米级精度且持续更新的地图;即使地图存在漂移、局部缺失或信息滞后,网络仍能根据当前真实观察判断可通行区域并生成下一段轨迹。因此,系统能够对建图误差保持更大的容忍度,也减少了地图质量对导航能力上限的直接约束。
4. 状态估计、建图与导航记忆:让系统拥有连续的世界
机器人看到的每一帧图像都是局部且短暂的。要完成长距离、跨房间甚至跨区域导航,系统必须知道自己在哪里、走过哪里,以及此前观察到了什么。
这一层包含三类互补能力:
VIO / 状态估计:融合相机与 IMU,估计位姿、速度和重力方向;
V-SLAM / 建图:维护稠密或稀疏几何信息,进行回环检测与地图优化;
Navigation Memory:在几何信息之上组织拓扑语义地图,维护房间、区域、连接关系、语义节点、地标库、视觉关键帧、访问记录和可通行位置。
我们希望形成的并不是一张只记录坐标和障碍物的地图,而是一张能够被 Agent 使用的拓扑语义地图。它记录机器人走过、看过区域的关键信息,例如有哪些房间、房间之间如何连通、门口和走廊位于哪里、某个视觉地标曾在哪个方向出现,以及哪些区域已经访问或仍待探索。
借助这张地图,机器人不仅能获得连续位姿,还能理解自己“位于客厅”“正在接近书房入口”或“处在走廊靠近目标房间的一端”。这种房间级与区域级定位能够直接服务任务推理、长程规划、记忆检索和失败恢复。与此同时,拓扑语义地图并不替代 VN 的实时局部判断:它告诉机器人宏观上在哪里、下一阶段应去哪里,VN 则根据眼前环境决定具体怎样安全通过。
5. Controller:把轨迹可靠地变成运动
局部导航层给出“应该怎样走”,控制层负责让机器人真正走出来。针对不同平台,可以采用 MPC、WBC、PID 或平台原生控制器,将局部轨迹转换为轮式机器人、四足机器人或其他移动平台的运动指令。
这一层关注轨迹跟踪、动力学约束和机体稳定性。通过保持统一的轨迹接口,上层导航能力可以迁移到轮式、足式以及其他移动机器人平台,而不必为每一种本体重新设计完整的智能系统。
03
不同时间尺度上的协同
五层架构的关键并不只是模块划分,更在于时间尺度的解耦:
Agent VLM 低频运行,负责任务推理、阶段决策和异常恢复;
VLN Grounding 中频运行,随着视角和子目标变化更新几何目标;
VN 与 Controller 高频运行,持续重规划、避障并跟踪轨迹;
状态估计与记忆持续更新,为所有层提供一致的空间和历史信息。
这种设计避免了两个极端:既不让高层模型陷入每一步底层控制细节,也不让局部规划器在缺少任务语义的情况下盲目前进。高层决定“下一步去哪里”,中层完成“语义目标在哪里”,高频模块解决“如何安全抵达”。
04
解耦也是一种面向模型演进的设计
Agent、VLN Grounding 与 VN 之间通过 Navigation Intent、Pixel / Point Goal 和 Local Trajectory 等明确接口连接。这种解耦不仅便于独立训练、评测和定位问题,也让整个系统能够持续吸收基础模型的进步。
当更强的开源 VLM 出现时,我们可以优先替换 Agent 或语义 Grounding 能力,而无需重新设计已经验证过的局部规划器、地图系统和控制器。更强的 VLM 会带来更好的任务理解、空间推理和目标定位,并通过稳定接口直接转化为整套导航系统的能力提升。未来,当 VLM 已经能够可靠完成导航语义落地时,VLN Grounding 甚至可以从独立模块演进为 Agent VLM 内部的一项原生能力。
反过来,VN 的独立性也意味着局部规划可以围绕实时性、安全性和跨环境泛化持续优化,而不必等待上层大模型同步升级。我们希望构建的不是一组彼此锁死的模型,而是一套各层可演进、关键模块可替换、整体能力可以快速继承新模型红利的系统架构。
05
数据基础设施:
系统能力持续生长的底座
通用导航系统不仅需要模型架构,也需要可扩展的数据与训练闭环。我们将数据采集、自动标注、统一数据集构建,以及离线评测和真机验证视为整体系统的一部分。
视觉导航数据通常包含 RGB-D、IMU、机器人轨迹、目标与语言描述。真实数据的几何和语义标注成本很高,因此,我们希望通过自动重建、轨迹对齐、可见性推理和视觉语言模型标注等方法,把大量原始机器人视频转化为可训练的空间与语义监督。
这种数据基础设施不应只服务某一个模型,而应支持 VN、VLN Grounding、导航记忆和 Agent 等不同模块独立训练与联合评测,并为后续真实环境适配提供低成本的数据来源。
长期来看,系统运行本身还会不断产生新的失败案例、困难场景和交互轨迹。这些数据经过筛选与自动标注后,可以再次进入训练和评测流程,形成从部署到学习、再回到部署的数据闭环。
06
从室内到室外,
从单点能力到完整系统
这套架构并不局限于某一种机器人或某一类场景。
在室内,系统可以围绕语义导航、长程回访、探索建图和动态避障展开:Agent 根据任务与记忆选择目标,VLN 完成语义落地,局部导航在家具和狭窄通道中生成安全轨迹。
在室外,道路地图、RTK/GPS 或其他全局定位信息可以提供粗粒度路线和 Local Goal;进入局部环境后,视觉导航继续负责对道路边界、障碍和可通行区域进行理解,并完成最后一段安全执行。
也就是说,全局先验可以变化,机器人本体可以变化,但“任务意图—几何目标—局部轨迹—运动执行”这一核心链路保持一致。
07
我们正在推进的路线
围绕这套总体架构,我们希望逐步建立以下能力:
可靠的视觉局部导航:提升陌生环境、复杂障碍和跨本体条件下的几何理解与闭环规划能力;
开放世界语义落地:让自然语言、视觉目标与可执行空间位置稳定对应;
长程记忆与地图协同:融合拓扑、几何和语义信息,支持跨区域导航与持续任务;
Agent 化任务执行:具备任务拆解、进度评估、失败诊断和自主恢复能力;
数据与评测闭环:统一仿真、离线数据和真实机器人评测,让系统能够持续迭代。
08
阶段性研究落地:
OccPlanner 与 L3ROcc
在上述整体路线下,OccPlanner 与 L3ROcc 是我们现阶段围绕 VN 和数据基础设施开展的两项具体探索。它们并不是视觉导航系统的全部:OccPlanner 聚焦目标感知和以 occupancy 为条件的高频局部规划,L3ROcc 则探索如何从大规模视觉数据中获得三维监督。
1.从一个像素目标到连续局部轨迹
OccPlanner 研究的是一个直接但并不简单的问题:当目标只以图像中的一个像素给出时,机器人怎样判断目标在三维空间中的位置,并生成一条能够避开障碍的连续局部轨迹?
Pixel Goal 为上层语义能力与下层局部规划提供了一个轻量接口。VLN Grounding 或 Agent 不必直接生成完整路径,只需在当前视野中指出目标;VN 则负责将这个二维提示还原成三维空间中的运动意图,并结合周围几何寻找安全的抵达方式。相比直接给出精确三维坐标,这种接口更容易由视觉模型产生,也更适合连接不断演进的 VLM。
2.让目标理解与障碍感知共同参与规划
OccPlanner 以一段 RGB-D 观察历史和当前像素目标为输入,内部包含共享几何编码、3D occupancy 预测和目标感知轨迹规划三个部分。
首先,共享 RGB-D 几何编码器从连续观察中提取时空特征。RGB 提供丰富的外观与语义信息,深度提供更直接的局部尺度和结构线索;多帧上下文则帮助模型理解相机运动以及仅凭单帧难以判断的几何关系。
随后,模型分别处理目标和障碍物信息。对于目标,它结合目标像素与观察画面,学习目标相对机器人的位置和方向。训练时加入机器人坐标系下的目标位置监督,帮助模型建立图像坐标与真实空间之间的对应关系。对于环境几何,模型将当前观察转换为机器人周围的occupancy结构。模型根据当前目标选择与行进方向相关的几何信息,从而判断障碍物位置和可通行空间。
最后,扩散规划器综合观察信息、目标方向和局部几何,逐步生成未来的连续轨迹。概括来说,Pixel Goal 回答“往哪里走”,occupancy 特征回答“哪里不能走、哪里可以走”,扩散规划则负责把两者组织成一段连续动作。
3.L3ROcc:从导航视频获得可扩展的三维监督
训练 occupancy-aware 局部规划器需要大量三维监督,但真实机器人视频通常只有图像和轨迹,很少包含逐帧体素标注。为此,我们构建了 L3ROcc 数据生成流程:从单目 RGB 导航视频中恢复共享场景几何和相机运动,再通过体素化与可见性推理,生成机器人中心的局部 occupancy、可见区域和对齐轨迹监督。
这使已有导航视频能够被转化为 OccPlanner 所需的训练数据,也为后续利用真实机器人采集进行低成本适配提供了基础。更长远来看,这也代表了一种可扩展的数据思路:让原始机器人视频经过自动处理后进入训练与评测闭环,而不是依赖昂贵的人工三维标注。
4.从闭环仿真到真实机器人观察
我们在 60 个未见过的室内场景中进行了 5,000 多次闭环导航测试,覆盖家庭、商业空间以及两类不同难度的杂乱环境。在 5–8 米长距离设置下,OccPlanner 的加权平均成功率达到 58.59%,相比 NavDP 的 11.65% 有明显提升;在轻度杂乱和高难度杂乱场景中,成功率分别达到 94.78% 和 91.44%。这些结果体现了显式局部 occupancy 推理在障碍密集、几何关系复杂环境中的价值。
下面的视频分别展示了 OccPlanner 在未见仿真环境和真实办公环境中的运行效果。
未见仿真环境演示
仿真演示覆盖了不同障碍密度和几何难度的 Easy / Hard cases。视频将第一视角观察与对应的局部几何、occupancy 表示及规划结果并列展示,可以直观看到模型如何根据 Pixel Goal,在未见场景中识别可通行空间并持续生成局部轨迹。
真实办公环境演示
真实环境演示同步给出了第三人称视角、局部几何表示和机器人第一视角(FOV)。面对箱体等临时障碍,视频中的红色轨迹展示了规划器如何结合实时观察更新局部路径,并在实际办公环境中完成闭环避障。
OccPlanner 并不是要让一个网络替代整个导航系统,而是在清晰接口下强化其中最需要实时视觉与局部几何推理的一层:它接收上层给出的目标,结合眼前观察持续产生局部轨迹,再交由控制器执行。它与 L3ROcc 一起构成了我们从系统蓝图走向可验证能力的一次阶段性落地。
09
结语
我们相信,通用机器人导航不会只来自更大的模型,也不会只来自更精细的地图或更强的控制器。真正可用的系统,需要语义智能、空间感知、局部规划、状态估计、记忆和控制在同一个闭环中协同工作。
我们的目标,是让机器人不仅能够“看见”环境、理解指令,还能够把理解转化为安全、连续、可执行的行动——从知道要去哪里,到真正走到那里。
关注+星标,获取AI前沿进展与开源一线动态
热门跟贴