✨导读: 传统视觉语言导航仿真无视双足机器人行走动力学、机身形态差异与步态带来的镜头抖动问题。本文基于NVIDIA Isaac Sim打造全物理仿真平台HumanoidVLN,配套87个高保真室内场景、933条人工核验导航指令,完成跨机器人、多VLN模型零样本测评,虚实对照实验证实仿真轨迹与真实世界行为高度匹配。
  • 作者:Quan-Dung Pham , Anh Dao , The-Anh Nguyen , Minh Nguyen-Dinh , Phuong Nam Dang , Tri Pham , Hung Tran , Bach Dao , Tuyen P. Le , Truong Nguyen , Quan Nguyen

  • 单位: VinMotion, 南加州大学

  • 论文标题:HumanoidVLN: A Physics-Grounded Simulator and Benchmark for Vision-Language Navigation Across Diverse Humanoid Embodiments

  • 论文链接:https://arxiv.org/abs/2608.12860v1

  • 项目主页:https://humanoid-vln.github.io/

研究背景

打开网易新闻 查看精彩图片

视觉语言导航(VLN)是具身智能落地人形机器人的核心能力,但现有仿真平台、数据集存在三大致命短板,完全无法适配双足人形机器人的真实作业逻辑:

  1. 仿真缺失人形专属物理约束⚠️: Habitat-Sim、AI2-THOR等主流VLN仿真依靠运动学瞬移,直接跳过双足行走动力学;现有基于Isaac Sim的工作仅把人形机器人当作通用机器人,不会针对不同下肢自由度、身高机型定制控制逻辑。 不同人形硬件差异巨大:下肢自由度10~12、机身高度1.17m~1.80m,会直接改变步幅、重心稳定性、行走镜头抖动幅度,传统平台无法还原真实物理差异。

  2. 场景未针对人形通行做筛选: 早期数据集基于Matterport3D,后续3DGS方案仅提升画面质感,却从不过滤狭小、障碍物密集空间;人形机器人需要开阔无障碍通行区域,狭窄环境会形成导航瓶颈,任务不具备物理可行性。

  3. 导航指令脱离真实行走观测: 现有基准全部采用稳定云台、均匀光照的理想画面;人形行走时镜头持续晃动、光影动态变化,真实观测环境完全不同。纯大模型自动标注极易出现空间幻觉,纯人工标注成本高昂,缺少兼顾效率与精度的标注方案。

四大核心贡献
  1. 多形态人形机器人物理仿真平台: 依托NVIDIA Isaac Sim搭建分层控制架构,支持宇树G1/H1、两款自研人形机器人;底层专属RL步态策略匹配机型动力学,上层可切换PD/MPC路径跟踪器,轻量化接入新机器人与VLN模型,兼容NaVILA、DualVLN、StreamVLN、JanusVLN四大主流模型。

  2. 通行性过滤Real2Sim实景重建场景库: 87个高保真室内场景,分为人工建模、3D高斯重建两类,硬性筛选可通行面积≥100㎡;覆盖住宅、商超、文旅、办公、医疗、健身6大领域,包含17种室内空间,中位数可通行面积266㎡,无需手工建模资产即可生成实景仿真环境。

  3. 多智能体+人工闭环校验指令数据集: 933条物理可行导航片段,每条配套1条精细空间指令+3种风格变体(正式/日常/随意);创新双生成器-校验器-转述MAA多智能体标注流程,搭配人工复核,大幅消除大模型空间幻觉。

  4. 跨机型、跨模型物理导向评测体系: 在真实动力学约束下零样本测评主流VLN模型,新增跌倒率FR指标量化行走稳定性;20组虚实对照实验证明仿真导航误差与真实场景强相关(皮尔逊相关系数 ),仿真结果具备现实参考价值。

HumanoidVLN仿真平台详解 4款形态差异化人形机器人

平台覆盖当下主流尺寸、自由度双足机器人,机身参数直接决定步态与观测效果:

双层分层控制栈
打开网易新闻 查看精彩图片
双层分层控制栈

区别于传统"瞬移式"仿真,整套控制逻辑完全还原真实双足行走过程:

  • 底层:机型专属RL步态策略每台机器人单独训练强化学习步态模型,输出关节扭矩,严格匹配自身关节限位、重心CoM动力学,完整复刻行走颠簸、失衡摔倒等真实物理现象。

  • 上层:双模式可切换路径跟踪器

    • PD跟踪器:适配离散动作类VLN模型(NaVILA/StreamVLN/JanusVLN),输出前进、左转、右转、停止离散指令;

    • MPC模型预测控制:适配连续速度输出模型(DualVLN),输出连续速度、航向角指令。 所有导航轨迹都会经过完整步态动力学推演,不存在瞬间传送的理想化操作。

极简通用VLN接入接口
  • 仿真器自动采集行走带来的全套多模态观测流:RGB视频、深度图、IMU惯性数据、相机位姿,自带步态造成的镜头抖动;

  • 新增VLN模型仅需实现标准观测-动作接口即可接入,无需修改仿真底层;新增机器人仅需导入URDF/USD模型+训练专属RL步态策略,拓展门槛极低。

️REAL2Sim实景重建管线 场景来源&通行性筛选标准
  • 场景分为两大来源:人工设计室内空间、3D高斯Splatting真实场景重建;

  • 设置硬性准入门槛:机器人可通行地板面积≥100㎡,通过碰撞网格自动化校验,直接剔除狭小、障碍物拥挤空间;

  • 最终87个场景覆盖6大应用领域、17类室内空间,兼顾仿真真实度与人形导航可行性。

优化版3DGS重建流程

基于开源gsplat库做多层改进,解决原始高斯重建法线杂乱、碰撞网格失真痛点:

  1. 新增无偏深度渲染+深度-法线一致性约束,平滑墙面、家具几何纹理,消除表面噪点;

  2. 通过COLMAP多视图SfM初始化高斯场,完成坐标系转换适配Isaac Sim仿真引擎;

  3. TSDF融合渲染深度图提取高精度碰撞网格,与3D高斯渲染图层打包为USDZ仿真资产,兼顾视觉效果与物理碰撞检测。

物理可行导航片段采样流程
  1. 根据机器人机身半径膨胀2D占据栅格地图,同步规避头顶低矮障碍物;

  2. 使用A*算法随机采样起点-终点导航路径;

  3. 机器人完整执行整条路径,同步记录RGB/深度/IMU观测数据;步态不稳定、中途摔倒的路径直接丢弃重采样,保证数据集内所有片段都包含真实行走带来的镜头抖动。

导航指令生成:MAA多智能体标注框架

打开网易新闻 查看精彩图片

本文创新双生成器-校验器-转述多智能体标注(MAA),搭配人工闭环校验,彻底解决纯大模型标注的空间幻觉问题,完整流程如上图所示

多智能体自动化生成&校验

  1. 双生成器独立推理Gemma-4-31B-it、InternVL3.5-38B仅依靠第一视角行走视频,输出标准化结构化路线图:

式中: 代表动作、 代表地标、 代表路径方位、 代表序数、 代表转向幅度;两个生成器输出路线自动合并,存在矛盾的节点送入校验器复核。

  1. 校验器多层几何核验Qwen3-VL-30B-A3B结合轨迹元数据、占据栅格A*路径、空间语义图三重信息,校验转向、地标、时序逻辑;几何类属性用确定性规则核验,语义完整性、指代准确性由大模型辅助判断。

  2. 多风格转述生成GPT5.5基于校验完成的精准指令,生成3种口语变体:正式、日常、随意;转述后会重新解析结构化路线,确保导航核心信息无丢失、无歧义。

人工闭环校验流程
  1. 3名专业标注员逐段核对视频、轨迹可视化图,修正地标、动作时序、终点判定条件;

  2. 随机抽取20%片段双人交叉复核,存在分歧时由第三名标注员仲裁; 最终产出933条独立导航片段,每条配套1条精细空间指令+3种风格变体。

全面实验结果解析 评测基础设置
  • 参评模型:NaVILA、StreamVLN、DualVLN、JanusVLN,全部采用零样本测评,不在HumanoidVLN数据集微调;

  • 测试机器人:Unitree G1/H1、Internal-A、Internal-B;

  • 传统VLN通用指标:成功率SR、先知成功率OS、导航误差NE、路径加权成功率SPL、路径相似度nDTW;

  • 人形机器人专属新增指标跌倒率FR,计算公式:

满足以下任一条件即判定为跌倒,直接终止当前片段:

  • T1动态跌倒:机身高度下降 ,向下速度>1.2m/s;

  • T2持续倒地: 维持2秒及以上;

  • T3轻度失稳: ,向下速度>1.5m/s; 为对应机器人标准直立高度。

实验1:跨模型、跨人形性能对比 1. 模型性能排名
打开网易新闻 查看精彩图片
  • JanusVLN综合最优:依托显式3D空间建模,平均SR=43.55%,平均nDTW=48.38;

  • DualVLN稳定性最强:连续速度输出设计让整体跌倒率最低,路径贴合度表现突出;

  • StreamVLN整体效果垫底,离散动作模型NaVILA终点停止判断误差最大。

2. 机身形态带来的巨大性能差异
打开网易新闻 查看精彩图片
  • Unitree H1(10自由度、1.8m高)在所有模型下性能大幅下滑,平均SR仅20.84%,跌倒率极其夸张:StreamVLN高达64.52%、NaVILA达70.95%;

  • Internal-A综合导航成功率最高,G1路径加权SPL指标最优;

  • 同一模型在不同机器人上,成功率SR最高差距可达18.9个百分点,足以证明人形机体形态会极大影响VLN导航效果。

实验2:3DGS重建质量消融对比
打开网易新闻 查看精彩图片
  • 原始gsplat重建出的墙面、家具法线噪声严重,生成的碰撞网格完全无法用于物理仿真;

  • 增加深度-法线一致性约束后,几何平滑度小幅提升,但大面积平面仍存在明显瑕疵;

  • 本文完整管线(无偏深度渲染+法线约束)生成连续光滑几何表面,TSDF融合后碰撞网格稳定可靠,可完全替代手工建模场景。

实验3:Sim-to-Real虚实一致性验证

选用Unitree G1+DualVLN,2个真实室内场景各10组导航片段,共20组虚实配对轨迹:
打开网易新闻 查看精彩图片
选用Unitree G1+DualVLN,2个真实室内场景各10组导航片段,共20组虚实配对轨迹:

  1. 仿真与真实导航误差高度线性相关:皮尔逊 ,斯皮尔曼 ;

  2. 虚实导航误差平均绝对差值仅0.68m,无系统性偏移偏差;

  3. 轨迹相似度nDTW均值 ,证实仿真重建场景能够完整复现真实环境的导航难度与运动轨迹。

全文总结 ✅核心成果

本文推出HumanoidVLN,全球首个面向多形态双足人形机器人、完全基于真实动力学的VLN仿真基准,一次性解决传统VLN平台三大核心痛点:

  1. 分层RL+PD/MPC控制栈精准还原不同人形真实行走约束,可量化步态失稳、摔倒风险;

  2. 自研3DGS实景重建管线,搭配通行面积前置筛选,批量产出物理可行的室内仿真环境;

  3. MAA多智能体+人工复核标注流水线,产出高精度、多风格导航指令数据集;

  4. 大规模跨机器人、跨模型零样本测评,清晰揭示人形硬件、控制器、VLN模型三者之间的耦合影响;虚实对照实验充分验证仿真结果具备真实世界落地参考价值。

⚠️现有局限
  1. 场景类别、空间多样性仍有扩充空间;

  2. 人工复核环节限制数据集大规模扩容;

  3. 全物理动力学仿真算力消耗较高。

未来研究方向
  1. 引入3D基础模型优化地标识别与指令空间对齐能力;

  2. 轻量化3D高斯重建管线,降低仿真算力开销;

  3. 在更多实体人形机器人上拓展虚实对照实验,完善跨硬件泛化性能验证。

Mbot具身智能实验室

让尖端科技触手可及,人人皆可探索未来

打开网易新闻 查看精彩图片

Mbot基础交流群等你加入,下方扫码联系

具身-杰西

Mbot具身-小助手

Mbot-视频号

Mbot-公众号