作者:Catherine Glossop , William Chen , Arjun Bhorkar , Dhruv Shah , Sergey Levine
单位: 加利福尼亚大学伯克利分校, 普林斯顿大学
论文标题:CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models
论文链接:https://arxiv.org/pdf/2508.13446v1
项目主页:https://cast-vla.github.io/
代码链接:https://github.com/catglossop/CAST
提出 CAST数据增强方法 ,通过利用视觉语言模型(VLM)生成反事实的语言和行动标签,以增加机器人数据集中语言的多样性和粒度。
通过在现有数据集上应用CAST,显著提高了VLA模型 遵循语言指令 的能力,使模型在导航任务中的成功率提高了27%。
开源相关资源 ,公开了CAST增强代码、CounterfactualVLA策略训练代码、CAST数据集以及训练好的检查点,以促进研究的可重复性。
VLA模型的挑战 :尽管VLA模型在将自然语言指令映射到机器人行动方面表现出色,但在遵循细粒度命令时仍面临困难,主要原因是现有机器人数据集缺乏语义多样性和语言基础。
数据集的局限性 :现有数据集在类似观察中缺乏细粒度的任务多样性,导致模型在面对相似环境时难以区分不同的语言指令。
解决方法 :论文提出利用VLM的先验知识,通过生成反事实标签来增强数据集,从而提高模型的语言遵循能力。
预备知识与问题陈述 目标
训练一个能够根据图像观察控制自主移动机器人遵循复杂语言指令的策略。
即: ,其中 是时间 的动作, 是观察(例如机器人摄像头的图像), 是语言指令,例如“沿着白墙移动”。
策略通常通过近似最大化数据集的对数似然来训练:
其中 是标记的数据集,下标 表示第 个轨迹, 表示该轨迹中的时间步。
如果数据集中的语言标签 对策略模型预测正确动作不是必要的,那么模型在测试时会忽略它,这种现象称为后验坍塌(posterior collapse)。
本文的目标是将一个未标记的数据集 转换为一个新的标记数据集 ,以便训练出一个有效的指令遵循策略。
为了使策略能够被语言指令引导,避免后验坍塌,仅仅在多样化环境和指令上训练策略是不够的。还需要不同的指令导致不同的动作,即使观察结果相似。
CAST(Counterfactual Augmentation with Synthetic Trajectories)的目标是为 中的任何观察生成多个动作-语言元组,使得策略必须关注语言指令才能产生正确的动作。
利用一个简单的原子策略(atomic policy),该策略遵循简单的原子语言指令(如“左转”或“右转”),并且比通用指令遵循策略更容易训练,且在短时间范围内可靠。
通过VLM生成与观察相关的反事实高级指令,并将其与原子指令相关联,然后使用原子策略生成相应的动作。
通过最大化语言和动作之间的条件互信息 来提高语言遵循能力。
通过增加不同原子标签 的执行次数,同时确保每个原子标签容易从完整语言指令 中预测,可以有效地最大化 的下界。
CAST通过生成多样化的反事实语言指令,对应于不同的原子指令,从而提高原子标签的熵,但给定完整指令时条件熵较低,从而推动语言和动作之间的互信息增加,进而提高语言遵循能力。
获取原子轨迹段和语言标签 :首先获取一个包含原子标签的数据集 ,并获取描述机器人实际执行轨迹的指令 。
生成反事实指令 :在 的每个观察点,利用VLM生成与原始轨迹在语义和几何上不同的替代指令 。
生成反事实轨迹 :对于每个反事实指令 及其原子指令 ,使用原子策略 采样动作标签 ,形成从原始轨迹分支出来的反事实轨迹,并将其添加到标记训练集中。
CAST被实例化用于视觉导航中的自然语言指令遵循任务。
由于缺乏大规模真实世界的视觉语言导航数据集,论文设计了两个组件来实现CAST:1)原子策略(atomic policy);2)事后重标记(hindsight relabeling)流程以获取语言标签。
原子标签生成 :对于数据集中的每个观察 ,计算一个原子标签 ,属于集合 {右转、左转、向右调整、向左调整、前进、停止},创建中间数据集 。
原子策略训练 :使用 训练原子策略 ,通过监督学习实现。原子策略使用 EfficientNet-b2 ConvNet 编码观察,使用 T5 语言嵌入来处理命令 ,然后通过 Transformer 生成上下文向量,最终使用扩散模型预测动作。
初始语言标签生成 :从现有的视觉导航数据集中,为每个机器人轨迹生成多个可能的语言指令 ,描述整个轨迹。
VLM 重标记 :使用 VLM(如 OpenAI 的 GPT-4)对轨迹的子采样观察序列进行提示,描述环境中的物体、结构及其相对位置,并总结这些描述以生成新的指令。
过滤和增强 :通过第二次提示 VLM,结合图像、之前生成的标签和轨迹上的原子标签序列,选择与原子标签序列一致的标签,过滤掉与轨迹不一致的指令,并查询 VLM 以获取额外的标签。
数据集选择 :在 GNM 数据集上运行 CAST,该数据集包含多种机器人(如小型轮式机器人、四足机器人和类似 ATV 的机器人)的室内和室外轨迹。
数据标准化和预处理 :将动作空间标准化为笛卡尔坐标增量,预测机器人在 xy 坐标上的移动。
模型架构 :使用 30 亿参数的 PaliGemma VLM 作为基础模型,包括 SentencePiece 语言分词器、SigLIP 400M 视觉模型和 Gemma 2B 语言模型,所有组件在训练过程中保持未冻结。
训练过程 :在 CAST 数据集上微调 PaliGemma VLM,训练一个高容量的语言条件策略,称为 CounterfactualVLA。
评估 CAST 是否能够使更有效的语言条件策略用于导航。
比较 CounterfactualVLA 与现有SOTA方法的性能。
确定哪种策略架构最适合利用 CAST。
任务类型 :27 个挑战性的视觉语言导航任务,分为三类:对象导航、参照导航和连续导航。
环境 :3 个真实世界环境,包括拥挤的办公室走廊、厨房和户外公共公园。
评估指标 :成功率,即策略成功完成任务的比例。
与标准 VLA 比较 :CounterfactualVLA 的平均成功率为 53%,比标准 VLA 提高了 27%。标准 VLA 在需要避碰的任务中表现较好,但在对象导航任务中表现较差。
与现有方法比较 :CounterfactualVLA 在所有任务类型中均优于现有的基线方法,总体性能提高了 19%。例如,CoNVOI 在对象和参照导航任务中表现稍好,但在连续导航任务中表现较差。
模型架构的影响 :CounterfactualVLA 使用 VLA 背景架构,能够更好地理解复杂的语言指令,而 ResNet+FiLM 架构在处理复杂语言指令时表现较差。
实验结论
CAST 通过生成多样化的反事实标签,显著提高了 VLA 模型在遵循复杂语言指令方面的能力。
CounterfactualVLA 在多个真实世界环境中表现出色,优于现有的基线方法。
使用高容量的 VLM 基础模型对于理解和遵循复杂的语言指令至关重要。
结论 :
CAST通过生成多样化的反事实标签,显著提高了VLA模型在遵循复杂语言指令方面的能力。CounterfactualVLA在多个真实世界环境中表现出色,优于现有的基线方法。
未来工作 :
扩展到其他领域 :探索将类似方法应用于机器人操作等其他领域。
结合其他技术 :将CAST与大规模模拟、生成性增强或跨机器人数据集结合,以进一步提高视觉多样性。
改进VLM的标注质量 :尽管VLM的标注速度较慢且质量参差不齐,但随着技术的进步,未来VLM将更快、更经济且更好地与物理世界结合,从而提高方法的实用性。
热门跟贴