人形机器人的感知驱动控制在具身智能领域已经展现出了重要的应用价值,尤其是在无需人工遥操作的前提下实现从仿真环境到物理硬件的技能迁移,已成为当前研究中的关键挑战。然而,现有方法通常依赖真实遥操作数据或人体动捕数据作为监督信号,难以同时获得第一人称视觉观测、语言指令与运动学轨迹的完整三元组。

本文介绍亚马逊、UC Berkeley等机构联合提出的VLK(Vision-Language-Kinematics)学习框架,旨在无需人工演示的情况下,在重建的3D场景中自动合成配对数据,从而训练出可直接部署于物理人形机器人的感知驱动控制策略。VLK以3D高斯泼溅重建场景为基础,通过将感知预测与全身跟踪执行解耦,在无需修改底层控制器的情况下实现对语言指令与视觉观测驱动的全身运动控制。VLK在支持目标导向导航与箱式物体搬运任务的同时,仍能保持高成功率的仿真与真实部署表现,为数据驱动的人形机器人控制提供了一种高效且可规模化的新思路。

打开网易新闻 查看精彩图片

论文题目: VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes 文章链接: https://arxiv.org/abs/2606.30645 项目主页: https://vision-language-kinematics.github.io
一、研究背景

人形机器人在真实室内环境中执行任务时,通常需要把第一视角感知、语言目标和全身控制连接起来。以“把地上的箱子拿起来并放到桌上”的动作为例,机器人必须识别箱子和桌子的位置,规划路径,协调腿部移动、上身弯曲、手腕接触和物体搬运。相比固定机械臂操作,此类任务状态空间更大、动作链更长,对视觉-语言-运动学三元组监督数据的需求也更迫切。

打开网易新闻 查看精彩图片

本文提出的VLK框架并不局限于在仿真环境中训练控制器,而是将真实场景重建为可渲染、可交互的三维环境,在该环境中合成人形机器人交互轨迹,并将学习所得策略部署到物理实体上。如上图所示,上半部分以A、B、C三类原子技能展示了虚拟合成与物理执行间的跨域一致性迁移,下半部分通过“导航-抓取-放置”的完整操作链,验证了系统在长时序闭环控制下的有效性。

打开网易新闻 查看精彩图片

本文方法的核心目标,是在无需采集目标任务真实遥操作数据的前提下,自动化生成用于训练人形机器人移动操作策略的视觉-语言-运动学三元组监督数据整体流程包含离线与在线两个阶段。离线阶段(上图上半部分):在重建的3D场景中,系统生成任务路径点,合成G1运动轨迹并渲染第一人称观测,构成VLK配对监督数据。在线阶段(上图下半部分):配对数据用于训练VLK策略,使其根据当前第一人称观测、语言指令与G1状态预测短时域运动轨迹部署时,全身跟踪器将预测轨迹转换为实际关节指令,完成物理执行。

2.1 在重建场景中生成 VLK 监督

VLK 的数据生成首先从真实室内场景重建开始。作者使用iPhone 14 Pro与Polycam扫描实验环境,融合RGB图像与LiDAR深度信息获取具有真实尺度的场景,并优化为 3D Gaussian Splatting(3DGS)表示[1],用于后续第一视角渲染,以保留真实环境的外观与空间布局。下图展示了生成的VLK监督数据样例。

打开网易新闻 查看精彩图片

为了支撑运动合成,VLK系统从重建场景中提取点云并手动标注两类关键信息:语义3D边界框(标注椅子、桌子、箱子等任务相关物体)和可行走区域。标注完成后,系统可以自动采样目标物体、机器人初始位姿与稀疏路点,并通过模板生成语言指令(如“walk toward the chair”、“pick up the box from the floor”、“put down the box on the table”)。

在运动合成阶段,任务可以划分为目标导航与物体交互两大类导航模型基于BONES-SEED中的G1运动训练,交互模型则将OMOMO数据集[2]中的人体-物体交互序列重定向至Unitree G1上。对于长度为 的G1运动序列,系统将其表示为:

打开网易新闻 查看精彩图片

其中, 表示全局关节位置, 表示 6D 关节旋转, 表示 G1 关节角。使用编码关节角,可以避免角度环绕带来的不连续情况对于物体交互任务,VLK系统还可以表示物体轨迹如下

打开网易新闻 查看精彩图片

其中, 是物体全局位置, 是物体相对标准姿态的旋转。交互合成模型则沿用条件扩散式人体-物体交互生成思路[3],但将运动表示修改为 G1 运动学形式并额外条件化初始物体状态、物体几何、手腕相对位姿和手腕-物体接触标签。

2.2 渲染第一视角并训练 VLK 策略

运动轨迹生成后,VLK系统就可以在Isaac Sim中回放G1运动,并在机器人头部搭载相机同时引入域随机化(涵盖光照、相机扰动及图像增强等)以缩小视觉差距。由此获得的每条VLK样本均包含了第一视角RGB图像、语言指令与全身运动学轨迹策略则以当前观测 、指令 及状态 为输入,预测未来 帧的运动学轨迹。

打开网易新闻 查看精彩图片

这里 对应 30 Hz 下未来 1 秒的运动目标。VLK 策略参数从预训练VLA 模型进行初始化,并在合成 VLK 数据上进行微调。训练采用 flow matching 风格的预测目标给定真实未来轨迹 、高斯噪声 和插值系数 ,构造含噪轨迹:

打开网易新闻 查看精彩图片

策略网络接收含噪轨迹、插值系数、图像、语言和当前状态作为输入并预测干净轨迹:

打开网易新闻 查看精彩图片

主损失为未来轨迹重建误差:

打开网易新闻 查看精彩图片

三、实验结果

本文在lab-style与apartment-style两种真实环境中进行了扫描与重建,每种环境构建了4种不同的家具布局。所有布局均通过iPhone 14 Pro搭载的Polycam应用采集,并优化为3DGS表示,既用于合成数据生成,也用于仿真评估。真实部署则在相同物理环境中进行,每次试验手动改变家具布局以验证泛化性硬件方面,系统部署于Unitree G1机器人,头部安装了定制的3D打印支架以拓宽视野,输入为ZED 2i左侧RGB图像(分辨率为 ),并缩放至VLK策略所需的 。推理时,VLK模型部署在一张RTX 5090上,全身跟踪控制器则部署于RTX 5000 Ada,二者协同完成实时闭环控制。

3.1 合成流程可以自动生成大规模 VLK 数据

作者在每个环境中设置4种重建布局与12种数据生成模式,其中6种为评估任务模式(Walk To、Turn Around、Pick Floor、Put Floor、Pick Surface、Put Surface),另外6种为辅助模式(随机行走、转向、搬运及搬运转向),用于丰富状态覆盖。每个布局、每种模式生成 1000 条轨迹,单环境共计48,000条轨迹。作者指出,在单张 NVIDIA L40S GPU 上,为一个布局中的一个模式合成 1000 条轨迹约需 4 小时,渲染对应第一视角观察约需 8.3 小时。这说明一旦完成场景重建和标注,后续视觉-语言-运动学监督可以通过并行合成快速扩展,而不需要人类逐条进行遥操作示范

3.2 将合成数据训练的策略网络迁移到真实 G1 场景中

对于性能评估,作者同时在MuJoCo仿真与真实的Unitree G1场景上进行。在仿真中,使用Isaac Sim从重建3DGS场景渲染第一人称RGB图像,VLK预测未来运动学轨迹后由全身跟踪器在MuJoCo中执行真实评估则在lab与apartment场景中开展,每任务模式20次,共120次真实试验。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

上表结果显示,VLK在导航与箱子操作上表现优异其中,真实lab场景中Walk To和Turn Around均达20/20,Pick (Floor)为16/20,Put (Floor)为20/20。真实apartment场景中Walk To为19/20,Turn Around为18/20,Pick (Floor)为18/20,Put (Floor)为20/20。相比之下,涉及到不同支撑面高度的操作更为困难

打开网易新闻 查看精彩图片

上图进一步分析了合成数据规模对不同任务性能的影响。实验表明,目标导航对数据量不敏感,仅使用10%的数据时,Walk To的成功率已接近90%,完整数据集下达到99%。相比之下,操作任务对合成轨迹规模表现出更强的依赖,Pick (Floor)随数据量增加提升至73%,而Pick (Surface)更是从10%数据时的0%提升至完整数据下的46%。这表明,涉及丰富接触交互且与场景几何强相关的操作任务,相比纯导航任务,更需要大规模场景化监督信号的支持。

3.4 视觉域随机化对性能的影响

作者进一步评估了渲染阶段视觉域随机化对缩小视觉差距的作用。实验在lab场景的walking-mode下进行,设置了四组对照,并引入光照与相机扰动。

打开网易新闻 查看精彩图片

上表结果显示,无随机化时模型的成功率为41%,仅相机随机化为48%,仅光照随机化提升至87%,完整随机化达到90%。这表明在该场景中,光照变化是影响渲染到真实视觉迁移的关键因素,相机随机化则增强了视角与标定的鲁棒性。因此,重建场景为策略提供了真实的几何与外观基础,域随机化进一步提升了其对真实视觉变化的泛化能力。

打开网易新闻 查看精彩图片

上表展示了真实部署场景中 VLK 推理的详细分析结果。系统完成一次重规划平均耗时约 63.0 ms,不会出现严重的推理延迟现象延迟主要来自远端GPU上的flow-matching采样与通信,共计37.0ms(占59%),其余环节的推理成本则更小。

四、总结

本文提出的VLK框架为人形机器人移动操作提供了一条以重建场景合成数据为核心的训练路径。VLK不再依赖目标任务的大规模真实遥操作数据,而是通过3DGS重建真实环境,借助场景先验信息自动合成G1导航与箱子交互轨迹,并渲染第一人称图像,构建视觉-语言-运动学三元组监督信号。实验表明,仅凭合成数据训练出的策略即可在真实Unitree G1机器人上完成导航、抓取、搬运与放置等系列任务且数据规模与视觉域随机化对最终性能均有显著影响。

参考

[1] Kerbl B, Kopanas G, Leimkuhler T, Drettakis G, et al. 3D Gaussian Splatting for Real-Time Radiance Field Rendering. ACM Transactions on Graphics, 2023.

[2] Li J, Wu J, Liu C K. Object Motion Guided Human Motion Synthesis. ACM Transactions on Graphics, 2023.

[3] Li J, Clegg A, Mottaghi R, Wu J, Puig X, Liu C K. Controllable Human-Object Interaction Synthesis. European Conference on Computer Vision, 2024.

Illustration From IconScout By IconScout Store

-The End-

本周上新!

扫码观看!

“AI技术流”原创投稿计划

TechBeat是由将门创投建立的AI学习社区(www.techbeat.net)。社区上线700+期talk视频,3000+篇技术干货文章,方向覆盖CV/NLP/ML/Robotis等;每月定期举办顶会及其他线上交流活动,不定期举办技术人线下聚会交流活动。我们正在努力成为AI人才喜爱的高质量、知识型交流平台,希望为AI人才打造更专业的服务和体验,加速并陪伴其成长。

投稿内容

// 最新技术解读/系统性知识分享 //

// 前沿资讯解说/心得经历讲述 //

投稿须知

稿件需要为原创文章,并标明作者信息。

我们会选择部分在深度技术解析及科研心得方向,对用户启发更大的文章,做原创性内容奖励

投稿方式

发送邮件到

yimingzhang@thejiangmen.com

添加工作人员微信(aceyiming投稿,沟通投稿详情

关于我“门”

将门是一家以专注于数智核心科技领域新型创投机构,也是北京市标杆型孵化器。 公司致力于通过连接技术与商业,发掘和培育具有全球影响力的科技创新企业,推动企业创新发展与产业升级。

将门成立于2015年底,创始团队由微软创投在中国的创始团队原班人马构建而成,曾为微软优选和深度孵化了126家创新的技术型创业公司。

如果您是技术领域的初创企业,不仅想获得投资,还希望获得一系列持续性、有价值的投后服务,欢迎发送或者推荐项目给我“门”:

bp@thejiangmen.com

打开网易新闻 查看精彩图片

点击右上角,把文章分享到朋友圈