英伟达世界模型技术路线全景解析:从Cosmos到GR00T的完整闭环 引言:物理AI的数据困境与NVIDIA的解题思路

人形机器人要真正走进现实世界,面临的核心瓶颈并非硬件,而是数据。一个通用机器人需要理解环境、规划动作、适应变化,这一切都依赖于大规模、高质量、多样化的训练数据。然而,真实世界中通过遥操作收集机器人演示数据,成本高昂且速度缓慢——收集数千小时的演示数据可能需要数月时间。

NVIDIA的解题思路清晰而激进:用AI生成AI所需的数据,用世界模型驱动机器人学习。围绕这一核心理念,NVIDIA构建了一条从“世界建模 → 数据生成 → 策略学习 → 仿真部署”的完整技术链路。本文将沿着这条链路,逐一拆解每个环节的核心算法与开源实现。

第一层:世界模型(World Models)—— 物理世界的“数字大脑”

世界模型是整个体系的基石。它的任务是:理解物理世界的运行规律,预测未来状态

打开网易新闻 查看精彩图片

Cosmos是NVIDIA为物理AI打造的世界基础模型平台,经过数百万小时真实世界数据训练,能够基于文本、图像或视频输入,生成物理准确的未来世界状态。

Cosmos模型家族经历了清晰的演进:

Cosmos-Predict1:第一代世界预测模型,支持图像/视频到未来状态的生成

Cosmos-Predict2:第二代,在质量和提示对齐上显著提升

Cosmos-Predict2.5(最新):基于流(Flow-based)架构,将Text2World、Image2World、Video2World统一到单一模型中,支持长达30秒的视频生成,后训练精度提升10倍,并支持多视角输出

Cosmos三大核心模型类型

模型类型

功能

典型应用

Cosmos Predict

根据图像、视频和文本生成“未来世界状态”视频

合成数据生成、世界仿真

Cosmos Transfer

基于分割、深度、边缘等多模态空间控制输入进行可控世界生成

Sim2Real(仿真到现实迁移)

Cosmos Reason

推理VLM,理解空间、时间和物理常识

任务分解、高层规划

1.2 Cosmos Reason(推理世界模型)

Cosmos Reason是专为物理AI打造的开源可定制推理视觉语言模型(VLM),它像机器人的“深度思考大脑”,利用物理常识和链式思维推理,将模糊指令转化为逐步执行计划。该模型在Hugging Face物理推理模型排行榜上位居榜首,下载量超100万次。

重要提示:Cosmos-Reason2已停止主动开发,未来所有更新将集中在Cosmos 3上。

1.3 Cosmos 3:全模态统一的世界模型

2026年6月发布的Cosmos 3是全球首款全开源全模态物理AI大模型,基于突破性的混合Transformer(Mixture-of-Transformers)架构,将物理推理、世界生成和动作生成整合到一个开放模型中。

核心架构:两塔设计

推理塔(Reasoning Tower):VLM架构,负责理解多模态输入、推理物理交互

生成器塔(Generator Tower):基于扩散过程,根据推理结果生成物理准确的视频和动作

两种型号

Cosmos 3 Nano:160亿参数,面向实时推理(如RTX PRO 6000)

Cosmos 3 Super:640亿参数,面向数据中心大规模部署(Hopper/Blackwell)

关键能力:Cosmos 3原生支持文本、图像、视频、环境音和动作的全模态理解与生成,将物理AI的训练和评估周期从数月缩短至数天

打开网易新闻 查看精彩图片

DreamZero是NVIDIA GEAR实验室提出的世界-动作模型(WAM),代表了超越传统VLA的全新范式。

核心思想:在同一个模型中联合建模动作生成与视频生成。传统VLA只预测动作,而DreamZero同时预测“未来世界会变成什么样”和“机器人应该怎么做”——这为模型提供了更丰富的监督信号。

与传统模型的本质区别

动作条件世界模型:x′ = f(x, a)(给定状态和动作,预测下一状态)

逆动力学世界模型:先预测x′ = f(x),再反推a = g(x, x′)(如DreamGen)

DreamZero(WAM):(x′, a) = f(x)(同时预测未来状态和动作)

模型规模与性能

140亿参数的自回归扩散Transformer(DiT),基于Flow Matching

通过系统优化实现7Hz的实时闭环控制

RoboArenaMolmoSpaces两项基准测试中双双登顶

在新任务与新环境泛化上相比最先进VLA实现超过2倍的提升

跨具身迁移能力

仅需10-20分钟的人类纯视频示范,即可在未见任务上带来超过42%的性能提升

仅需30分钟的“玩耍数据”,即可适配全新机器人硬件

开源地址:https://github.com/dreamzero0/dreamzero

重要演进:NVIDIA Isaac GR00T 2(下一代机器人基础模型)正是基于DreamZero研究,采用世界-动作模型架构构建。

第二层:数据生成蓝图(Data Generation Blueprints)—— 合成数据的“工厂”

有了世界模型作为“物理引擎”,NVIDIA构建了高效的数据生成流水线,用极少量的真实演示生成海量合成训练数据。

打开网易新闻 查看精彩图片

DreamGen是NVIDIA GEAR实验室发起的四阶段合成数据生成流程,核心目标是“用GPU算力替代人类遥操作数据采集”。

四阶段流程

阶段1:微调视频世界模型
↓ 用少量真实演示数据适配Cosmos-Predict2,学习目标机器人的动力学
阶段2:生成合成视频
↓ 用初始帧+语言提示,让世界模型“想象”出多样化的机器人执行视频
阶段3:提取伪动作
↓ 通过潜在动作模型(LAM)或逆动力学模型(IDM)从视频中提取动作标签
阶段4:训练机器人策略
↓ 用这些带伪动作标签的“神经轨迹”训练下游视觉运动策略

惊人的数据效率

仅需一个环境中的单一拾取-放置任务的遥操作数据

即可让机器人执行22种新行为,在10种新环境中实现零样本泛化

跨平台验证:DreamGen已在GR1人形机器人、Franka单臂机器人、SO-100(100美元机械臂)等多种平台上验证有效。

开源地址:https://github.com/NVIDIA/GR00T-Dreams

2.2 GR00T-Mimic

GR00T-Mimic是Isaac Lab中的合成操作运动生成蓝图,核心理念是“人类在真实机器人上收集演示 → 在仿真中将数据扩增1000倍或更多”。通过该蓝图,NVIDIA在11小时内生成了780,000个合成轨迹,相当于6,500小时的人类演示数据。

实际效果:将合成数据与真实数据结合训练GR00T N1,相比仅使用真实数据,性能提升了40%。GR00T N1.5模型借助该蓝图,仅用36小时即完成开发——而传统人工数据收集需要近三个月

第三层:机器人基础模型(Robot Foundation Models)—— 机器人的“大脑”

由前两层产出的海量合成数据训练而成,这是直接赋予机器人智能的核心模型。

3.1 GR00T N1

GR00T N1是全球首个用于通用人形机器人推理和技能的开源基础模型,是一个视觉-语言-动作(VLA)模型,采用双系统架构

系统

功能

实现

System 2(慢思考)

理解环境、解读指令、做出规划

视觉语言模块(VLM)

System 1(快思考)

高频生成精确关节动作

扩散Transformer(DiT)

两个模块紧密耦合、端到端联合训练。训练数据包括真实机器人轨迹、人类视频和合成数据集。在标准仿真基准上,GR00T N1超越了最先进的模仿学习基线。

论文:https://arxiv.org/abs/2503.14734

3.2 GR00T N1.5

基于N1的升级版本,采用优化后的VLM,训练数据包括真实数据、仿真数据和DreamGen生成的合成数据的多样化组合。

3.3 GR00T N1.6

截至2026年1月CES发布的最新稳定版本,主要增强:

增强推理与感知:使用Cosmos-Reason-2B VLM变体,支持原生分辨率

流畅自适应动作:扩散Transformer扩大2倍32层)+ 状态相关动作预测

优化的跨形态性能:在数千小时多样化遥操作数据上训练(人形机器人、移动机械臂、双手机械臂)

GR00T N1.6集成了NVIDIA Cosmos Reason作为推理引擎,将高层指令分解为基于场景理解的逐步动作计划。

技术博客:https://developer.nvidia.com/blog/building-generalist-humanoid-capabilities-with-nvidia-isaac-gr00t-n1-6-using-a-sim-to-real-workflow/

3.4 GR00T N1.7(最新抢先版)

GR00T N1.7是当前最新版本(Early Access),主要更新:

新VLM骨干:Cosmos-Reason2-2B / Qwen3-VL

预训练数据增强:新增2万小时EgoScale人类视频数据

泛化与指令跟随能力提升:性能与N1.6相当,但泛化能力和语言跟随能力显著改善

开源协议:Apache 2.0,完全可商用

开源地址:https://github.com/NVIDIA/Isaac-GR00T

第四层:仿真与部署工具(Sim-to-Real)—— 从虚拟到现实的“桥梁”

最后,NVIDIA提供了将虚拟智能迁移到物理世界的完整工具链。

4.1 Isaac Lab

Isaac Lab是NVIDIA的机器人仿真训练平台,支持全身强化学习(RL)训练,生成动态稳定的运动原语(行走、操作、接触密集型行为)。策略在仿真中大规模训练后,可零样本迁移到真实机器人。

4.2 GR00T-WholeBodyControl(含SONIC)

GR00T全身控制(WBC)是用于开发和部署高级人形控制器的统一平台。当前支持:

解耦WBC:用于GR00T N1.5/N1.6的控制器(下半身RL + 上半身IK)

GEAR-SONIC系列:最新一代通用人形全身控制器

MotionBricks:实时潜在生成模型,用于动画和机器人的交互式运动控制

低延迟SONIC:G1控制器变体,支持端到端VLA工作流

开源地址:https://github.com/NVlabs/GR00T-WholeBodyControl

4.3 COMPASS

基于合成数据训练的导航模块,与GR00T N1.6的仿真到现实工作流集成。

4.4 Newton物理引擎

NVIDIA联合Google DeepMind、Disney Research开源的物理引擎,基于NVIDIA Warp和OpenUSD框架,由Linux Foundation管理、GPU加速。

4.5 完整的Sim-to-Real工作流

GR00T N1.6的仿真到现实工作流整合了以下组件:

Isaac Lab(全身RL训练)

COMPASS(合成数据驱动的导航)

CUDA加速视觉定位(cuVSLAM、FoundationStereo、nvblox)

真实机器人部署(零样本迁移)
技术路线图总览
打开网易新闻 查看精彩图片
如何Follow NVIDIA的工作:实践建议 1. 明确切入点

根据你的目标选择合适的起点:

目标

推荐切入点

开源地址

数据生成

GR00T-Dreams + Cosmos-Predict2.5

https://github.com/NVIDIA/GR00T-Dreams

模型训练与部署

GR00T N1.7

https://github.com/NVIDIA/Isaac-GR00T

世界模型研究

Cosmos 3

https://github.com/nvidia/Cosmos

世界-动作模型

DreamZero

https://github.com/dreamzero0/dreamzero

全身控制

GR00T-WholeBodyControl

https://github.com/NVlabs/GR00T-WholeBodyControl

2. 硬件要求

训练:推荐8×H100(DreamZero训练需25天)

微调与推理:RTX 4090或A6000

实时部署:NVIDIA Jetson Thor

3. 学习路径

阅读核心论文:GR00T N1论文、DreamGen论文、Cosmos技术报告

克隆代码仓库:从Isaac-GR00T或GR00T-Dreams开始

准备演示数据:收集视频、状态、动作三元组

微调预训练模型:使用自定义数据适配

仿真验证:在Isaac Lab中测试

真实部署:迁移到真实机器人

总结

NVIDIA的世界模型战略核心可以概括为“用AI生成和模拟世界,再让AI在那个世界中学习”。从Cosmos世界模型到GR00T-Dreams数据生成,从GR00T N1系列到DreamZero WAM范式,再到Isaac Lab仿真部署,NVIDIA构建了一条从虚拟到现实的完整闭环技术链路。其演进方向清晰可见:

分离模型(Predict/Transfer/Reason)→ 统一模型(Cosmos 3)

VLA(GR00T N1)→ WAM(DreamZero/GR00T 2)

真实数据采集 → 合成数据生成(DreamGen)

对于开发者而言,这一开源体系提供了从数据到模型到部署的完整工具箱,使得构建通用人形机器人从未如此触手可及。

Mbot具身智能实验室

让尖端科技触手可及,人人皆可探索未来

打开网易新闻 查看精彩图片

Mbot基础交流群等你加入,下方扫码联系

具身-杰西

Mbot具身-小助手

Mbot-视频号

Mbot-公众号