打开网易新闻 查看精彩图片

这项由GigaAI与清华大学联合开展的研究,以技术报告形式发布于2026年7月15日,编号为arXiv:2607.13960,感兴趣的读者可通过该编号检索完整论文。

**机器人为什么需要"想象力"?**

假设你正在厨房做一道从没做过的菜。你不仅要知道下一步该切什么、炒什么,还要在脑子里预判:如果我现在加盐,锅里的汤会变成什么样?如果我翻炒太猛,食材会不会焦?这种"提前在脑子里演练结果"的能力,是人类烹饪时无意识使用的一项核心技能。

机器人控制领域正面临类似的挑战。传统机器人的"大脑"学习方式相对简单——看到当前的画面,输出一个动作指令,仅此而已。这就好比一个厨师完全凭直觉炒菜,既不预判结果,也不联系食材的实际反应,只是机械地按食谱执行每个步骤。这样做出来的菜,质量自然难以保证。

近年来,研究者们开始给机器人配备"想象力"——让它在执行动作之前,能够预测自己的动作会让眼前的场景发生怎样的变化。这种能力被称为"世界模型"。把这种世界模型与动作决策融合在一起的系统,研究者称之为"世界行动模型"(World Action Model,简称WAM)。

然而,带着想象力工作虽然更聪明,却也更耗时。如果机器人每次动作前都要完整地"脑补"出未来几秒钟的视频画面,计算量将极其庞大,根本无法满足实时控制的需求。这就像一个厨师每翻炒一下,就要完整地把接下来五分钟的烹饪过程在脑子里演一遍,显然效率太低。

正是为了解决这个矛盾,GigaAI与清华大学的研究团队提出了GigaWorld-Policy-0.5——一个既保留了"想象力"带来的聪明,又大幅提升了运行速度的机器人控制模型。

**一、"想象"只在训练时用,执行时直接出手**

GigaWorld-Policy-0.5的核心设计理念,可以用"平时多练,上场不想"来概括。

在训练阶段,模型被反复告知:你的动作,会让眼前的画面产生怎样的变化。通过大量这样的"动作—场景变化"配对训练,模型内部逐渐形成了一种深刻的"物理直觉",知道怎样的动作会带来怎样的结果。这种直觉被编码进模型的参数之中,成为一种隐含的知识。

而在实际执行阶段,模型不需要再把完整的未来画面"演"出来,而是直接根据积累的物理直觉,输出最合适的动作序列。正如一个经验丰富的厨师,炒菜时不需要刻意思考"我翻一下锅,食材会移动多少厘米",因为这些感觉已经融入了他的肌肉记忆。

这种"训练时有世界模型监督、推理时只输出动作"的设计,来自其前身GigaWorld-Policy。GigaWorld-Policy-0.5在此基础上做了多项重要升级,形成了更快、更强的新版本。

**二、厨房里的分工:视觉专家与动作专家各司其职**

GigaWorld-Policy-0.5最重要的架构创新,是引入了一种叫做"混合变换器"(Mixture-of-Transformers,简称MoT)的设计。

为了理解这个设计的妙处,可以把整个模型比作一个餐厅厨房。以前的设计就像一个全能厨师,无论是切菜、炒菜还是摆盘,全部由同一个人完成。这样虽然灵活,但效率不高,而且切菜用的技能和炒菜用的技能混在一起,训练起来也更复杂。

新的MoT设计则像是设立了两个专职岗位:一位"视觉专家"负责处理画面信息,理解当前场景并预测未来场景的变化;另一位"动作专家"专门负责生成机器人的动作序列。两位专家通过一个共享的"沟通会议"(多模态自注意力模块)交换信息,保持协作。

这样设计的关键好处在于:当机器人实际执行任务时,只需要启动"动作专家",而无需运行庞大的"视觉专家"。就像餐厅打烊后只需要收银员结账,不必把整个厨房团队都留下来。这样一来,推理时的计算量大大减少。

在具体的参数配置上,视觉专家使用了隐藏维度3072、全连接层维度14336的较大规格,而动作专家则采用了隐藏维度1024、全连接层维度4096的更轻量规格。动作专家的参数初始化来自视觉专家的对应权重,对于维度不匹配的参数,则取视觉专家权重的前n个维度来填充。视觉专家则直接使用了GigaWorld-1这个大规模预训练世界模型的权重,从而继承了强大的视觉理解能力。

两位专家之间的信息交流,遵循一套精心设计的"信息隔离规则":动作专家可以看到当前的画面、机器人的状态和语言指令,但绝对不能看到未来的预测画面;反过来,视觉专家在预测未来画面时,可以参考动作序列。这套规则确保了"动作决策不受未来预测污染",同时又让未来预测能够依赖动作信息,形成了合理的因果方向。

**三、预训练的秘密:让模型同时学"世界变化"和"动作导致的变化"**

除了架构上的创新,GigaWorld-Policy-0.5在训练策略上也做了重要改进,这便是"混合预训练"策略。

在此之前,大多数世界行动模型的预训练只做一件事:同时预测动作和未来画面,即标准的WAM训练。这就像一个学徒只跟着老师做菜,观察食材在锅里的自然变化,却没有专门练习"当我做某个特定操作时,食材会怎么变"。

GigaWorld-Policy-0.5的混合预训练策略在标准WAM训练的基础上,额外加入了"动作条件世界建模"(Action-Conditioned World Modeling,简称AC-WM)训练。在这种训练模式下,模型被专门告知当前的动作是什么,然后要求它预测在这个动作下,场景会如何演变。这就像专门练习"我往左翻锅时,食材会朝哪个方向移动"。

这种针对性的训练,让模型对"动作与场景变化之间的因果关系"有了更深刻的理解,从而学到了更具迁移性的动作表征。在后续针对特定机器人任务的训练(后训练阶段)中,这种预训练打下的基础使得模型收敛更快、表现更好。

整个训练流程分为两大阶段。在预训练阶段,研究团队使用了2000小时经过筛选的开源机器人数据,以及内部采集的真实机器人数据,让模型适应机器人相关的场景、视角和交互模式。在后训练阶段,则在目标机器人的真实轨迹数据上进行精调,让模型专门学习在特定任务场景下的动作生成。

**四、让机器人更快的工程细节:缓存、编译与C++**

完成了模型设计之后,研究团队还在工程层面做了三项针对性的优化,将推理速度推向了实用边界。

第一项优化是KV缓存(Key-Value Cache)。在生成动作序列的过程中,画面信息和语言指令在每一步都是固定不变的,没有必要每次都重新计算。研究团队将这部分计算的中间结果保存下来,在后续每一步生成动作时直接复用,避免了大量重复计算。这就像厨师在处理同一批食材时,不必每次都重新测量,直接用第一次称好的克重就行。

第二项优化是使用PyTorch的`torch.compile`进行图编译。这个操作可以把模型的计算流程在底层进行重新组织和优化,减少Python层面的调度开销,实现算子融合和更高效的内存使用。效果类似于把一套繁琐的手工流程改成了自动化流水线。

第三项优化是部署C++运行时。研究团队将图像预处理、张量构建、模型执行、KV缓存管理和动作后处理全部整合进一个统一的原生C++流水线。这彻底消除了Python的运行时开销,也方便与机器人控制中间件对接。

通过这三项优化的叠加,GigaWorld-Policy-0.5在本地RTX 4090显卡上实现了85毫秒的推理延迟,达到了真实机器人部署所需的实时控制水平。

**五、AutoResearch:用AI来帮AI找到最佳训练配方**

研究中还有一个值得单独介绍的有趣环节,那就是"AutoResearch"。

训练一个神经网络模型,有很多参数需要调节,比如学习率(模型每次更新参数的步伐大小)、批量大小(每次用多少数据更新模型)以及训练步数等。这些参数的选择对最终结果影响巨大,却没有放之四海而皆准的标准答案,传统做法需要研究者凭经验反复尝试。

AutoResearch是由著名AI研究者Andrej Karpathy开源的一个自动化研究流水线工具。研究团队将其引入GigaWorld-Policy-0.5的训练配置搜索中,让它自动完成候选配置生成、短期试运行、验证指标收集、候选筛选,以及延长训练等全套流程。

具体来说,研究团队在"水果抓取"任务上,用约3.9小时的机器人演示数据(930条轨迹,其中300条用于训练,30条用于验证)开展了超参数搜索实验。AutoResearch首先对多个学习率候选值(包括3×10??、4.316×10??、6×10??、8×10??)各自运行1000步的短期试验,快速比较它们的训练动作损失、训练视觉损失和验证动作均方误差。

结果显示,6×10??的学习率取得了最低的训练动作损失(0.252476)和最佳的验证动作均方误差(0.409764),尽管它的训练视觉损失略高于3×10??的配置。由于动作预测质量与下游任务执行更直接相关,AutoResearch选择了6×10??作为进一步搜索的基础。随后,AutoResearch又固定学习率,对批量大小进行了扫描,结果表明原始批量大小16已是最优选项,无需更改。最终确定的训练配方为学习率6×10??、批量大小16,延长训练至30000步时模型达到最佳验证表现。

**六、真实机器人上的表现:用数字说话**

研究团队在AgileX PiPER 6自由度机械臂上开展了系统的真实机器人评测,分为"文本跟随"和"长时序任务"两类。

在文本跟随测试中,每次任务分为四个等权重的评分阶段,每阶段0.25分,分别是:触达目标物体、抓取目标物体、移动到目标放置位置、成功放置物体。研究团队在"水果抓取"任务上测试了六种水果(香蕉、苹果、柠檬、葡萄、牛油果、草莓),每种进行10次真实测试取平均。GigaWorld-Policy-0.5的平均成功率达到0.85,比π0.5高出0.09,比Motus高出0.05,比FastWAM高出0.07,比GigaWorld-Policy高出0.05。其中柠檬和牛油果的提升最为明显,说明模型对细粒度语言描述的理解能力有所增强。

在"物品摆放"任务上,模型需要根据指令同时理解目标物体(碗、叉子、汤匙)和目标位置(盘子上或篮子里),平均成功率达到0.89,超过最强基线Motus的0.83。碗放篮子和叉子放篮子这两条指令上的提升尤为突出,表明模型对物体身份和空间目标的联合推理能力得到了加强。

在三项长时序任务(食物加热、固体称重、餐具整理)中,每项任务执行10次,只有全程完成才算成功。GigaWorld-Policy-0.5分别取得了0.80、0.70、0.80的成功率,平均达到0.77。相比最强基线Motus的平均0.57,绝对提升达到0.20,相对提升约35%。这类任务对模型的挑战更大,因为任何中间步骤的失败都会导致整体失败,而GigaWorld-Policy-0.5表现出的强健性说明世界模型提供的时序预测能力确实有助于长时序任务的执行。

在推理速度方面,标准配置下GigaWorld-Policy-0.5在A100显卡上的延迟为189毫秒,在本地RTX 4090上为110毫秒,启用C++部署后进一步降至85毫秒。相比之下,GigaWorld-Policy(前代)在A100上为360毫秒,FastWAM为229毫秒。而作为对比,Motus因为需要在推理时生成视频,在A100上的延迟高达3231毫秒,根本无法满足实时控制需求。

**七、消融实验:每个设计都是有意义的**

为了验证各项设计的实际贡献,研究团队做了细致的消融实验。

在AC-WM混合预训练的消融实验中,两个模型在相同的后训练数据和配置下进行比较,区别仅在于预训练时是否加入AC-WM。结果显示,加入AC-WM的版本在后训练的每个阶段都保持领先,收敛更快,最终成功率从未加入时的75%提升到了85%。特别是在20000步时,加入AC-WM的模型已经达到了80%的成功率,而未加入的版本同一时刻只有68%,说明AC-WM带来的收益在训练早期就已经显现。

在MoT架构的消融中,研究团队通过对比推理延迟数据,验证了专家分离设计的效率优势。由于动作专家比视觉专家更轻量,在只需要执行动作推理时,跳过视觉专家的计算可以显著减少计算量,这也是85毫秒低延迟得以实现的关键。

说到底,GigaWorld-Policy-0.5做的事情,在工程上非常务实:把"想象力"这件昂贵的事情,限制在训练阶段做;把"快速反应"这件紧迫的事情,留到实际执行时用。两件事各归其位,互不干扰,这才是让机器人又聪明又快的根本逻辑。

机器人领域的发展方向越来越清晰:光靠记住"看到A就做B"已经不够,机器人还需要理解"做B会让世界变成什么样"。而GigaWorld-Policy-0.5给出的答案是,这种理解可以在训练时建立,而不必在每次动作时重新演算,从而在不牺牲表现的情况下,让机器人在真实世界中真正"跑得起来"。

有兴趣深入了解的读者,可以通过arXiv编号2607.13960查阅完整论文。

Q&A

Q1:世界行动模型(WAM)和普通的机器人控制模型有什么区别?

A:普通机器人控制模型只是根据当前画面直接输出动作,不考虑动作会产生什么结果。世界行动模型则会同时预测动作和该动作引发的未来场景变化,相当于机器人在动手之前先"脑补"一遍结果,这样学到的动作策略更符合物理规律,也更可靠。

Q2:GigaWorld-Policy-0.5的85毫秒延迟是什么概念,为什么对机器人控制这么重要?

A:85毫秒大约是人眨一次眼睛所需时间的一半左右。对机器人来说,如果控制系统响应太慢,机器人的动作就会跟不上实时变化的环境,容易出错甚至失败。通常认为100毫秒以内是实时控制的基本门槛,85毫秒意味着GigaWorld-Policy-0.5可以在普通消费级显卡上满足真实机器人部署的速度要求。

Q3:AutoResearch是什么,为什么要在机器人研究中使用它?

A:AutoResearch是一个自动化搜索训练配置的工具,由AI研究者Andrej Karpathy开源。训练神经网络时需要调整很多参数,比如学习率,手动试错费时费力。AutoResearch会自动运行一批短期实验,根据验证指标筛选出好的配置,再延长训练,整个过程不需要人工干预,节省了大量反复调参的时间。