具身世界模型综述
A Survey of Embodied World Models
https://www.preprints.org/frontend/manuscript/97505e9c3d2227bb313252975283b11c/download_pub
摘要
世界模型已成为一个关键的研究方向,生成式人工智能近期的突破凸显了其在推动通用人工智能发展方面的潜力。对于具身智能而言,世界模型对于使机器人能够有效理解、交互并在现实物理环境中做出明智决策至关重要。本综述基于一种新颖的技术分类体系,系统梳理了具身世界模型的最新进展。我们按照模型架构、训练方法、应用场景和评估方式对领域进行分层组织,从而为研究人员提供清晰的技术路线图。我们首先深入讨论了基于视觉的生成式世界模型和潜在空间世界模型,及其相应的训练范式。随后,我们探讨了具身世界模型在机器人应用中的多重角色,从作为基于云端的仿真环境到作为设备端的智能体大脑。此外,我们总结了评估具身世界模型的重要维度,以作为基准测试参考。最后,我们概述了关键挑战,并展望了这一重要领域中富有前景的未来研究方向。我们在https://github.com/tsinghua-fib-lab/Awesome-Embodied-World-Model上汇总了本综述讨论的代表性工作。
关键词:世界模型;具身智能
1. 引言
世界模型涉及构建世界状态的表示并对状态转移进行建模,近年来已成为一个前沿研究课题。世界模型的概念可以追溯到关于假设性思维的心理学研究[22],该研究认为心智会在内部模拟未来的世界状态。2018年,Ha等人[36]在强化学习中引入了AI时代早期的世界模型实现,巧妙地将高维感知输入的空间压缩与时序动态建模结合在一起。最近生成式AI的蓬勃发展极大地推动了世界建模研究,交互式视觉生成模型[1,11,98,99],如Genie [11]和HunyuanWorld [98],在视觉生成和未来状态预测方面都展现出了卓越的能力,使其成为强大的世界模型实现方案。与这些视觉显式方法并行的,是以JEPA [3]为代表的另一种范式,该范式主张采用潜在空间的世界状态表示,以实现更高效的行动规划。虽然这两个方向都在快速发展,但它们的相对优劣仍有待进一步探索。为了对该领域进行结构化梳理,我们根据生成模态、控制信号和生成视角对现有的具身世界模型进行了分类,如图1所示。
当前具有代表性的世界模型大多局限于虚拟游戏环境[11,35,113,131]和自动驾驶[31,108,111]。针对具身场景的世界建模是一个新兴领域,而构建强大的物理世界模型是实现具身智能体达成通用人工智能(AGI)的关键技术路径。这类具身世界模型对于机器人有效理解环境并与之交互至关重要。通过构建准确的世界表示,这些智能体能够学习推理、做出明智决策、适应新场景并产生有效行动。世界模型对具身智能体的关键优势体现在两个主要方面。首先,通过编码物理环境及其转移动态的表示,具身世界模型有助于在复杂的现实场景中进行长时程规划[17],这种能力超越了基础模仿学习方法的局限性。其次,通过提炼通用的世界先验知识,它们显著增强了分布外(OOD)泛化能力[130],从而能够稳健地适应以前未见过的任务和场景。
从技术角度来看,当前的具身世界建模方法主要遵循三种架构范式:基于视频生成的模型,其在可观察的视觉空间中运行[24,112,139];融入几何表示的3D重建增强模型[49,71,123];以及保持压缩状态表示以实现高效机器人行动规划的潜在世界模型[3,117]。前两种方法扩展了既有的计算机视觉和多模态生成技术,用于在像素空间中对世界状态进行建模,而第三种范式则侧重于学习世界紧凑的潜在表示。在训练方法方面,具身世界模型通常采用条件生成目标,结合外部指令来预测状态转移,包括文本条件生成[52,63,65,139]和基于行动轨迹[34,115,141]控制的未来预测。最近的进展引入了视觉-行动联合预测框架以增强行动理解[61,107,140],以及物理约束学习范式[93,135]以确保生成内容符合物理规律。
具身世界模型在机器人应用中扮演着三个主要角色。首先,它们充当基于云端的数据合成引擎[52,53,132],生成高质量合成训练数据,这对于训练诸如VLA(视觉语言行动)和VLN(视觉语言导航)模型等先进机器人策略模型至关重要。其次,它们充当环境代理[62,73,85],支持在模拟环境中评估具身智能体,而无需真实环境。最后,它们可以作为机器人的设备端“大脑”[3,126,137],执行实时未来状态推理以指导机器人行动规划。为清晰起见,我们将现有的代表性具身世界模型按三个维度进行组织:模态、行动类型和应用,如图1所示。
现有关于相关主题的综述主要分为三类,如表1所示。第一类是关于通用世界模型的综述[20,120,142],这些工作广泛讨论了概念的演变、基本功能以及在各领域的应用,覆盖面广,但缺乏对底层技术的深入分析。第二类聚焦于自动驾驶中的世界模型[23,29,33,101],对该特定领域的最新进展进行了全面概述。第三类包括与具身AI相关的综述[64,69,72]。虽然这些工作讨论了开发具身智能体的通用技术(包括世界模型),但并未提供专门针对具身世界模型的系统性技术综述。与之不同的是,我们的综述是首篇聚焦于具身世界模型的综述,沿着技术路线精心组织,全面讨论了从模型架构、训练范式到应用与评估的全栈技术。
本综述的主要贡献可概括如下:
我们对快速发展的具身世界模型研究进行了系统且最新的回顾,总结了世界模型对具身智能体的重要价值。
我们提出了一种新颖的技术分类体系,将本领域按模型架构、训练方法、应用场景和评估方式分层组织,为研究人员提供了清晰的技术路线图。
我们强调了具身世界模型的未来研究方向和趋势,以及有前景的未来研究问题,以进一步激发学界后续的研究。
本综述的后续内容结构如下:第2节介绍与具身世界模型相关的基本概念和背景。第3节深入探讨当前具身世界模型的模型架构。第4节讨论具身世界模型的训练范式。第5节探索具身世界模型的功能和应用。第6节介绍具身世界模型的多样化评估视角。最后,第7节讨论当前的挑战并概述该领域的未来研究方向。本综述的整体框架如图2所示。
2. 背景
世界模型的概念起源于认知科学。克雷克(Craik)的心智模型理论[56]提出,人类通过构建抽象的内部表征来感知和推理外部世界。系统动力学研究进一步强调了内部模型在模拟和预测复杂系统行为中的作用[26],从而为强化学习和机器人控制奠定了概念基础。20世纪90年代,萨顿(Sutton)的Dyna架构[95]首次将学习、规划和反应统一起来,展示了智能体如何通过学习和利用内部环境模型来加速策略改进。与此同时,施密德胡贝尔(Schmidhuber)引入了一种神经系统,首次明确地将控制器与世界模型分离[88-90]。在该设计中,控制器选择行动以最大化累积奖励,而世界模型则学习预测环境动态,从而实现多步前向规划。这确立了世界模型的核心原则——将策略与环境模拟解耦,并利用模型进行内部推演。
近三十年后,这一逻辑在深度学习时代得以复兴。哈(Ha)和施密德胡贝尔[36]在机器学习中重新引入了“世界模型”这一术语,并提出了一种包含三个组件的层次化架构:用于决策的控制器(C)、用于压缩高维感知输入的视觉模型(V),以及作为世界模型以捕捉时序动态的记忆模型(M)。从概念上讲,这反映了20世纪90年代控制器-世界模型分离的思想,但采用了现代深度神经网络实现,从而提供了更强的表示、压缩和规划能力。通过在潜在空间中模拟环境并预测假设结果,该框架显著提高了跨任务的泛化和迁移能力,尽管早期应用仍受限于计算资源不足和算法不成熟。在这一不断演进的发展背景下,涌现出了具有代表性的世界模型,其中包括体现了自回归范式的Genie [11],以及展示了扩散-Transformer架构在高保真动态世界生成方面潜力的Sora [142]。
具身智能的概念可以追溯到20世纪50年代图灵(Turing)的提议,他强调机器智能不应局限于符号推理,还必须具备感知和行动能力,以便与环境进行交互[102]。20世纪80年代,布鲁克斯(Brooks)及其同事推进了这一思想,批评传统人工智能过度依赖符号表征,并提出了基于行为的机器人学,强调智能通过具身化和与环境交互而涌现[10]。这项工作确立了感知-规划-控制(PPC)循环的基本范式。如图3所示,在这一框架下,传统方法主要采用分层架构:感知依赖于视觉模型,高层规划基于逻辑规则[27],低层执行则依赖于经典控制算法[28]、模仿学习和强化学习。然而,这些方法严重依赖人工设计,且层间信息流动受限,阻碍了对复杂环境的适应能力。
在当前大模型时代,具身学习与决策的格局由两种突出的、并行演进的范式所定义:视觉-语言-行动(VLA)模型和世界模型。在此,我们对它们进行详细的对比分析,以揭示其根本差异。首先,在输入和输出信息方面,VLA模型和世界模型通常都以文本指令和当前观测作为输入,部分VLA架构还额外纳入了机器人状态。在模型输出方面,VLA模型直接生成预测的行动供机器人执行,本质上充当了从感知和语言到行动的直映射。相比之下,世界模型输出的是未来观测序列,既可以是显式的视觉帧,也可以是潜在表示。从这一预测生成最终行动通常需要后续步骤,例如引入行动解码器,或采用拒绝采样进行最优行动规划。我们在图4中展示了VLA模型和世界模型在具身决策中的工作流程及输入输出对比。其次,在基础模型架构方面,VLA模型从根本上建立在自回归大语言模型(LLM)骨干之上。这种方法将视觉和行动信息与文本进行分词和对齐,实质上将具身决策重新定义为语言空间中的令牌预测任务。相比之下,世界模型通常采用以视觉为中心的生成模型(如DiT)作为骨干。其核心功能是将文本和行动信息与时空视觉令牌对齐,从而生成未来视觉状态。我们在图5中展示了它们令牌学习范式的对比示意图。
这两种方法各有优劣。VLA模型仍然遵循传统的模仿学习路径,从人类遥操作数据中学习视觉感知、语言理解和行动执行之间的直接映射。VLA的主要优势在于,利用高质量遥操作数据进行策略预热非常有效,并且继承了LLM卓越的复杂指令理解和推理能力。然而,它们存在三个主要缺陷:(1)数据可扩展性差,因为遥操作数据收集成本高昂;(2)泛化能力有限,因为它们通常在理想化环境中训练,难以应对分布外场景;(3)缺乏常识,因为仅靠模仿学习无法对物理世界的深层因果原理进行建模。与之不同,世界模型旨在通过从大规模无监督数据中学习状态动态,建立对物理世界的内部预测性理解。其主要优势在于数据效率和可扩展性,因为世界模型可以利用大量未标记的视频数据进行训练。它们还通过学习通用世界动态和概念组合,提供了更好的泛化能力。世界模型的主要缺点在于当前技术尚不成熟,其对深度行动和指令理解的能力仍需大幅提升。
鉴于物理世界从根本上由时空视觉动态构成,而视觉令牌比语言令牌的高层语义抽象能够更准确地捕捉这种动态,我们认为,从长远来看,世界模型是更具前景、更适合具身学习的范式。当前世界模型的前沿研究大致遵循三个方向。其一是基于视频的方法,该方法将世界概念化为连续的图像序列,通过预测未来帧来学习环境动态,从而隐式地捕捉物理规律和物体交互。这条路径的优势在于,可以利用互联网上几乎无限供应的二维视频数据,来学习高度复杂且高保真的视觉动态。其二是3D增强的世界模型,这类模型优先考虑几何准确性和物理一致性,使其对于机器人等安全关键型应用不可或缺。此外,以JEPA [3]为代表的第三个方向,则强调在潜在空间中学习紧凑且抽象的世界状态表示。通过在隐式表示层面建模环境动态,这类模型能够更高效地支持行动预测和规划,同时还能提供更强的抽象和泛化能力。
随着模型架构的演进,具身世界模型的训练范式也日趋多样化,这在很大程度上反映了模型所承担的功能角色。当世界模型被设计为数据生成引擎时,其主要目标是合成高保真的观测数据,以促进下游策略学习。在这种情况下,通常采用指令条件训练、行动条件训练、基于风格迁移的方法以及物理信息驱动的方法,来增强生成数据的真实性和多样性。相比之下,当世界模型充当边缘侧策略优化器时,重点转向直接指导智能体进行策略生成。在这种情况下,视频-行动联合训练正成为主导范式。此外,由于当前世界模型在泛化能力和可控性方面仍存在持续性的局限,基于强化学习的训练已越来越多地被用于提高在复杂动态环境中的鲁棒性和适应性。
世界模型在具身智能中最终扮演着模拟和预测引擎的多重角色。首先,它们充当基于云端的数据合成工具[49,52],生成高质量的观测数据,以支持视觉-语言-行动和视觉-语言-导航等先进策略模型的训练。其次,它们充当环境代理[62,85],使智能体的评估无需依赖真实世界环境。最后,世界模型可以作为机器人的设备端“大脑”[3,137],执行实时未来状态推理以指导行动规划。通过这种方式,世界模型在数据生成、环境评估和在线决策中发挥着核心作用,构成了具身智能发展的重要基础。
3. 具身世界模型的架构
当前具身世界模型主要分为三种架构范式,其区分依据是世界状态的表示空间,并且各自针对具身智能的不同核心需求而设计:基于视频生成的模型(图6a)在可观测的视觉空间中运行,主要在二维像素空间中合成高质量的机器人视频数据,同时对世界进行建模;3D重建增强模型(图6b)融入了显式的三维几何表示,用于编码深度、体积结构和物体姿态,从而在三维空间中实现物理一致的世界建模;潜在世界模型(图6c)则保持紧凑的压缩潜在状态,通过从冗余的感知数据中提炼与任务相关的信息,在低维潜在空间中对世界进行建模,以提升效率,从而促进高效的状态推理和行动规划。
3.1. 基于视频生成的模型
视频生成模型近来已成为许多具身世界模型的骨干架构,因为它们为模拟高保真且时序连贯的视觉动态提供了可扩展的基础。核心挑战在于,如何将这些模型从非交互式的视频生成器转变为交互式的世界模型,其中行动条件化和因果结构对于具身智能至关重要。总体而言,这一方向涌现出了三种架构范式:基于扩散的模型、自回归模型,以及两者结合的混合方法,如图7所示。
基于扩散的模型。扩散模型最初是为无条件或文本条件视频合成而设计的,通过引入因果机制和行动条件化机制,正越来越多地被改造为世界模拟器。一个里程碑式的进展是OpenAI于2024年发布的Sora[81],它实现了前所未有的照片级真实感和长时程视频生成,标志着首个能够产生电影级画质的工业级规模扩散模型的诞生。在此基础上,社区推出了Open-Sora[138],这是一个开源项目,重新实现了高效的视频VAE和扩散Transformer骨干,使大规模视频合成研究不再局限于专有系统。最近,Wan[104]进一步推动了开源生态中基于扩散的建模,提供了13亿和140亿参数规模的变体,采用流匹配(flow-matching)和大量精心整理的数据集进行训练。Wan集成了新颖的时空VAE、可扩展的预训练策略以及多任务扩展功能,包括文本生成视频、图像生成视频、指令引导编辑和实时生成,在多个基准测试中持续取得最先进的性能。作为这些大规模基础模型的补充,CogVideoX[124]展示了扩散Transformer在长时程合成方面的可扩展性,而Vid2World[48]则提出了“因果化”方法,将自回归推演和因果行动引导直接嵌入扩散流水线中。总体而言,这些进展表明,基于扩散的模型已从通用的视频合成工具迅速演变为具有因果基础、行动条件化和时序可扩展性的多功能世界模拟平台,但同时仍面临推理效率、响应速度和实时交互性等方面的挑战。
自回归模型。自回归模型与扩散方法的不同之处在于,它们按顺序生成视频令牌——逐帧或逐块生成——从而天然地编码了因果性和时序连续性。这使得它们天然适合具身推演场景,因为行动和状态必须在一致的时序顺序中演进。通过基于过去令牌对每个预测进行条件化,自回归系统支持直接的行动集成,从而实现低延迟的交互式控制。Genie[11]是最早的大规模自回归世界模型之一,展示了高容量Transformer能够捕捉行动条件化的动态并生成响应式的短时程推演。在此基础上,Lumos-1[128]展示了将自回归Transformer扩展到数十亿参数量如何提升可控性和长期稳定性,而iVideoGPT[115]则引入了高效的视频令牌化方案,显著降低了序列预测的计算负担。这些工作共同凸显了自回归建模的主要优势——实时响应性、直接的因果基础和流畅的时序演化——同时也揭示了其局限性:它们通常难以达到扩散模型所实现的视觉保真度和风格多样性,并且扩展到长时程时可能导致误差累积,从而使推演质量随时间下降。
混合模型。为了融合两种范式的优势,混合设计利用了扩散模型的高质量合成能力,同时结合了自回归的因果基础和交互性。Genie 2[18]是该方法的典型代表,它集成了用于视觉保真度的扩散骨干和用于保持交互性的自回归推演机制,从而实现了比其前代更长、响应更快的模拟。NOVA[19]则通过完全舍弃向量量化并采用连续空间自回归公式,进一步推进了混合范式。它引入了一种两级机制——时间维度上的逐帧因果预测和空间维度上的逐组掩码预测——并辅以扩散风格的去噪目标。尽管规模紧凑(6亿参数),NOVA在文本生成视频基准测试上取得了与最先进扩散模型相当的结果,同时在训练和推理方面显著更高效。除此之外,VideoGPT[115]在自回归推演中融入了扩散先验蒸馏以增强真实感,而MAGI-1[100]则通过分块生成扩展了混合自回归-扩散建模,实现了高效的流式视频合成、可控的长时程推演以及万亿令牌规模的实时部署。最近,Roboscape-long[91]引入了一种自回归框架,执行可变长度的分块去噪,从而能够生成长时程的具身视频。总体而言,这些系统表明混合设计代表了自回归和扩散范式的自然演进方向,将真实感、因果性和效率统一起来,不过在优化稳定性和扩展到超长推演方面仍存在挑战。
总体而言,基于视频生成的 world models 沿着三条互补的轨迹发展:(i)通过因果机制和行动引导扩展增强的基于扩散的方法;(ii)直接支持交互和实时推演的自回归设计;(iii)融合两种范式以同时实现可控性和真实感的混合方法。这些进展共同凸显了从通用视频生成向具身模拟的转变,为 world models 奠定了基础——使其不仅具有视觉真实感,还具有因果基础、交互性,并能适应智能体的行动。
3.2. 3D重建增强模型
将3D重建融入世界模型已成为提升动态世界建模真实感和几何一致性的关键方向[4,47]。重建为生成提供结构先验,而生成反过来丰富重建,形成双向交互。
现有研究大致遵循两条路径:级联范式和统一范式。如图8所示,级联模型显式重建3D几何并渲染新视角(例如3DGS、NeRF),而统一模型则将多视角先验(如深度图、法线图和光线图)整合到单一框架中。在级联范式中,重建输出作为记忆或条件引导被纳入生成过程。Wu等人[118]引入了一种带有层次化记忆模块的视频世界模型,包括短期工作记忆、以点云表示的长期空间记忆和稀疏情节记忆。这种设计使模型能够在长视频序列中保持空间连贯性。Chen等人[15]提出了一种新颖的世界模型,将点云和相机位姿嵌入视频生成器中。通过注入3D结构先验,该模型实现了高保真、可控的世界模拟。Zuo等人[144]提出了GaussianWorld,这是一个在3D高斯空间中对场景演化进行建模的框架。通过显式利用重建先验并以RGB观测为条件,该模型生成了几何一致的视频预测。反过来,生成模型也可以促进重建。Min等人[78]提出了一个基于4D预训练框架的世界模型,通过从过去的多相机图像和行动中预测3D占用,学习紧凑的时空鸟瞰图表示,为下游任务提供了更好的可扩展性。Zhao等人[134]展示了新颖轨迹合成和多视角视频生成可以作为4D重建的丰富监督信号,从而提高重建质量。Ni等人[80]通过提出ReconDreamer进一步推进了这一思想,该模型引入了渐进式轨迹扰动和在线恢复,以增强在大视角偏移下的鲁棒性。为解决跨视角不一致问题,Ni等人[79]开发了WonderFree,将视频扩散先验与跨视角一致性约束相结合,实现了高效且视角对齐的视频生成。类似地,HunyuanWorld [98]采用了一种分阶段流水线:Panorama-DiT生成全景先验,而深度重建确保结构对齐。该系统支持多种下游任务,包括图像到3D物体合成和天空生成。在机器人领域,最近的一些模型正在推动生成式AI在操作任务中的应用边界。EnerVerse [49]将视频生成和4D高斯泼溅统一为一个闭环。EnerVerse-AC [54]引入了一种新颖的动作图来控制具身场景中的视频生成。此外,ORV [123]还提供了精确的语义和几何线索,以增强生成结果的时间一致性和可控性。
在统一范式中,几何和动态被共同表示在单个神经框架内,以避免级联流水线固有的误差累积。Aether [97]将深度和光线图重建融入生成建模,实现了类人的空间推理能力。其设计支持对真实世界场景的强零样本泛化。Chen等人[16]提出了DeepVerse,这是一个4D自回归世界模型,在共享状态空间中统一了视觉、深度和位姿信息。通过引入几何感知记忆机制,DeepVerse在复杂环境中保持了长期空间一致性。Geo4D [55]预测了额外的物理信息,包括点图、深度图和光线图,以实现对场景更完整的理解。Zhen等人[135]提出了TesserAct,利用RGB-D-法线监督和一致性正则化来增强生成的4D具身世界的时空一致性。未来预测和统一感知同样受到重视。Wu等人[114]引入了Geometry Forcing,将隐式扩散特征与外部几何先验(如VGGT)对齐,表明学习结构化几何并不总是需要显式的3D标注。最近,Shang等人[93]提出了RoboScape,一个物理信息驱动的世界模型,集成了时序深度预测和关键点动态学习。通过编码几何一致性和物理属性(如物体形状和材质),RoboScape增强了视频渲染的保真度并改进了复杂运动建模。
总体而言,3D重建增强的世界模型沿着两条轨迹发展:级联模型将重建作为生成先验或记忆纳入,而统一模型则以端到端方式联合学习几何和动态。级联方法强调利用外部模型,而统一方法则突出表示的内在耦合。两者共同极大地增强了时序连贯性、几何保真度和物理推理能力,为能够理解并模拟物理世界的可扩展世界模型铺平了道路。
3.3. 潜在空间世界模型
当从时间快照(如视频帧或游戏画面)构建世界模型时,直接在像素层面建模环境动态会在反馈过程中产生过高的计算成本,并且往往导致模型过拟合冗余细节,从而阻碍泛化和推理[121]。因此,越来越多的工作致力于将时序数据映射到潜在空间,并在其中构建世界模型。近年来具有代表性的工作汇总于表3。我们在图9中给出了基于像素的重建世界模型与潜在空间世界模型的简要对比示意图。
Hafner等人[39]提出了PlaNet,这是一个纯粹的基于模型的智能体,它直接从像素观测中学习潜在动态,并在潜在空间内执行在线规划。PlaNet采用了循环状态空间模型(RSSM),该模型结合了确定性潜在转移和随机性潜在转移,在保持计算效率的同时实现了稳健的长期预测。其关键创新在于潜在超调目标(latent overshooting objective),该目标在潜在空间中正则化多步预测,而无需昂贵的像素重建。实验表明,PlaNet在基于像素的连续控制任务上取得了具有竞争力的表现,与环境交互次数比无模型基线方法减少了多达200倍。
在PlaNet的基础上,Hafner等人[38]提出了Dreamer,将潜在动态建模扩展到策略优化。Dreamer将世界模型学习和策略学习解耦:首先通过潜在超调和像素重建训练世界模型,然后完全在潜在想象中训练演员-评论家智能体。通过将分析值梯度沿想象的潜在轨迹反向传播,Dreamer在20个视觉控制任务上达到了最先进的数据效率,在训练时间更少的同时,性能优于基于模型和无模型的方法。注意到高斯潜在变量在捕捉多模态环境转移方面的局限性,Hafner等人[40]提出了DreamerV2,用分类变量取代了高斯潜在变量,并通过直通梯度进行优化。DreamerV2还引入了KL平衡(KL balancing),通过解耦先验和后验分布的学习率来稳定训练。在Atari 2600基准测试中,DreamerV2成为首个使用单个GPU在55个任务上达到人类水平表现的潜在想象智能体,超越了此前无模型基线如Rainbow和IQN。最近,Hafner等人[42]引入了DreamerV3,这是一个完全通用的算法,在超过150个任务中(涵盖连续和离散控制、视觉和本体感觉输入、稀疏和密集奖励)使用固定超参数学习稳健的世界模型。DreamerV3整合了多种鲁棒性技术——symlog变换、two-hot回归、基于百分位的回报归一化以及带有自由比特的KL平衡——这些技术共同实现了在信号尺度和奖励结构差异巨大的情况下稳定学习。值得注意的是,DreamerV3是首个无需人工演示或课程设置,从零开始在Minecraft中收集钻石的智能体,解决了开放世界探索中一个长期存在的挑战。
尽管Dreamer系列在模拟域中取得了显著成功,但其对密集奖励信号和高保真行动标签的依赖使得直接迁移到真实世界环境面临挑战。2022年,LeCun[59]阐述了联合嵌入预测架构(JEPA)作为概念性转变:智能体不是重建像素或优化任务特定奖励,而是学习一个潜在空间,在该空间中未来观测可以从过去观测中预测。这一思想首先由Assran等人[2]在图像领域以I-JEPA实现,该方法在单张图像中掩蔽大块空间区域,并训练ViT从可见上下文中预测掩蔽区域的表示。通过摒弃手工数据增强和像素级损失,I-JEPA产生了语义丰富的特征,在ImageNet分类和低级视觉任务上表现出很强的迁移能力,同时GPU训练时间比同类生成方法少一个数量级。
时间维度上的对应工作由Bardes等人[8]在V-JEPA中同时开发。V-JEPA从200万个公开视频中采样的短视频片段上运行,掩蔽时空立方体,并训练一个预测性Transformer来推断缺失的潜在表示。重要的是,其目标纯粹是预测性的——未使用任何行动标签、文本或像素重建——然而所得的冻结骨干在Kinetics-400和Something-Something-v2上取得了具有竞争力的准确率,在线性探测下超越了先前的自监督视频方法。这些结果表明,大规模、无行动的视频数据集足以学习通用世界表示。
受掩蔽预测可扩展性的启发,Assran等人[3]随后引入了V-JEPA 2,将编码器扩大到10亿参数,并在2200万小时精心整理的网络视频和100万张图像上进行训练。渐进式分辨率调度使其能够高效吸收时序上下文,而无需过高的计算成本。结合注意力探测(attentive probes),V-JEPA 2在运动中心基准(如Something-Something-v2和Epic-Kitchens动作预期)上达到了新的最先进水平,同时在以外观为中心的任务(如ImageNet)上也保持了竞争力。关键的是,V-JEPA 2的潜在空间可以通过最少的额外监督重新用于具身规划。通过冻结预训练编码器,并仅使用Droid数据集中62小时未标记遥操作数据训练一个轻量级、行动条件化的预测器,作者获得了V-JEPA 2-AC,一个能够在未见过的实验室环境中对Franka机械臂执行拾放任务的零样本模型预测控制的潜在世界模型。这首次证明了主要依靠被动网络视频训练、仅依赖视觉的世界模型能够在无需任务特定奖励或演示的情况下实现闭环机器人操作。
与上述发展同时,另一条互补的研究路线探索了面向任务的潜在动态和离线到在线的微调,以弥合仿真与真实部署之间的差距。Hansen等人[44]提出了TD-MPC,这是一种基于模型的强化学习算法,在学习的潜在空间内执行局部轨迹优化,同时通过时序差分学习联合训练终端价值函数。TD-MPC摒弃了像素重建目标,而是直接从奖励信号中学习潜在表示,在高维连续控制任务上展现了卓越的样本效率。在TD-MPC基础上,Feng等人[25]引入了TD-MPC-offline,该算法结合了不确定性感知规划和离线预训练世界模型,实现了在真实机器人上的小样本微调。具体而言,他们在离线机器人数据集上预训练潜在世界模型,然后使用测试时正则化器(平衡估计回报与认知模型不确定性)进行仅20次在线试验的微调。该框架展示了从离线数据到在线适应的稳健迁移。沿着这一研究方向,Hansen等人[43]提出了TD-MPC2,这是一个可扩展且稳健的通才世界模型,使用单一超参数集在104个多样化的连续控制任务上学习——包括高维运动、灵巧操作和生理精确的肌肉骨骼控制。TD-MPC2利用隐式、无解码器的潜在动态和归一化的任务嵌入空间,实现了跨形态和行动空间的泛化,在多达3.17亿参数规模下保持了训练稳定性的同时达到了最先进的性能。
综合来看,从Dreamer到JEPA的发展描绘了一条清晰的时间轨迹:早期的潜在动态研究侧重于掌握具有密集奖励的模拟器,而JEPA系列则将注意力转向从互联网开放式的视觉流中学习通用世界表示。TD-MPC及其后续方法的出现进一步补充了这一轨迹,为将潜在世界模型从离线预训练迁移到在线真实世界控制提供了一个原则性框架,从而缩小了模拟智能与物理智能之间的差距。最新进展表明,一旦配备了可扩展的预测目标和适量的交互数据,这些表示便能在物理世界中启动有效的规划,进一步缩小了模拟智能与现实世界智能之间的差距。
4. 具身世界模型的训练范式
根据世界模型应用场景的不同,其训练范式也有所差异。当世界模型作为数据生成引擎时,其目标是生成高质量的观测数据,用于下游策略学习。此时,世界模型的训练范式主要包括指令条件训练、行动条件训练、基于风格迁移的训练和物理信息驱动的训练。当世界模型作为边缘侧行动规划器时,其目标是指导智能体生成策略。此时,世界模型的训练范式主要是行动条件训练和视频-行动联合训练。此外,现有世界模型在泛化能力和行动可控性方面仍存在不足。因此,越来越多的研究者开始采用基于强化学习的训练方法来训练世界模型。这是因为强化学习训练范式能够弥补单纯依靠视频像素拟合的学习目标难以习得的特性,例如运动可控性和几何准确性。世界模型训练范式的示意图如图10所示。
4.1. 指令条件训练
在该训练范式中,世界模型的输入包括历史观测序列和基于文本的控制指令。这一训练范式源于传统的可控视频生成模型,因为文本指令可以为生成过程提供高层控制信号。
当Sora [70]首次提出时,它被视为一种世界模型,因为它能够根据文本指令生成长时程、高质量的视频。然而,它无法与控制信号进行实时交互。RoboDreamer [139]将复杂指令分解为细粒度的短句,并拼接相应的视频片段,实现了对未见任务的零样本组合。此外,Pandora [119]进一步用基于扩散的帧合成增强了自回归骨干,允许实时文本编辑,同时通过历史缓冲区保证跨域视觉一致性。Cosmos [1]将分层扩散渲染器与学习到的牛顿物理模块统一起来,实现了文本驱动的长时程、物理合理场景生成,并可通过连续控制信号进行实时引导。
4.2. 行动条件训练
尽管文本信息的高层控制可以引导模型生成不同视频,但难以提供细粒度的控制信号。行动序列由于包含细粒度的控制信息,可用于增强世界模型的细粒度感知和生成能力。在行动条件训练范式中,世界模型接收行动序列和观测序列作为输入,并根据行动控制信号生成未来观测。行动序列被视为对物体的控制信号序列,能够影响物体且可控,在具身AI中通常指具身智能体的目标位姿。
在该训练范式中,一个关键挑战是如何注入行动信号,使其既具有因果性又可控制。Vid2World [48]将机器人的6自由度位姿轨迹表示为密集行动张量,并在每个U-Net解码器块之前通过与视觉潜在特征进行逐元素相加,将其注入扩散过程。在时序注意力层中应用因果掩码,确保时间t的预测仅依赖于当前时间戳之前的行动,从而保持时序因果性。Unified World Models [140]将行动和图像的扩散时间步解耦,允许灵活的边际化或条件化。它们不是直接相加,而是将行动令牌与潜在图像块拼接,让Transformer通过交叉注意力联合去噪两种模态。EnerVerse-AC [54]引入了一种多级行动条件化机制,其中从末端执行器位姿渲染的空间行动图与图像潜在特征拼接,同时通过交叉注意力层融合增量行动嵌入,从而实现更精细的时空控制。FLARE [137]则完全避免了密集的像素级注入。它在扩散Transformer中将一小组可学习的未来令牌与以行动序列为条件的未来观测的潜在嵌入对齐,实现了隐式世界建模,且不增加额外的架构复杂性。此外,还有一些行动注入方法,例如使用行动控制Transformer模块处理连续和离散行动信号[125]。连续向量在经过时空压缩后按通道拼接。离散编码在交叉注意力中作为键/值对处理,允许单一预训练扩散骨干融合行动信息。
4.3. 物理信息驱动训练
尽管扩散和自回归模型可以生成视觉上引人入胜的视频,但它们常常违反基本物理定律——物体漂浮、液体穿过固体,或人体关节以不可能的方式弯曲。物理信息驱动训练将物理相关先验显式注入学习目标中,以缩小模拟到现实的差距。这些物理先验主要包括物体的固有属性,如硬度、弹性、颜色、材质等;空间结构信息,如深度、法线、点云;动态交互信息,如关键点轨迹和运动速度或加速度;以及环境物理参数,如光照、力或力矩方向、碰撞约束和相对运动。尽管物理约束众多,但本研究的核心问题在于如何选择合适的物理规律并将其有效整合到世界模型中。
RoboScape [93]是该范式的典型代表,它在共享的自回归骨干中融合了RGB和深度分支:预测的深度逐层作为物理先验注入,而自监督的关键点轨迹则捕捉接触驱动的动态;两者共同强化空间连贯性,并缩小模拟到现实策略的差距。TesserAct [135]采用4D实体建模方法,提取几何、材质和运动的底层编码,然后路由特定任务的掩码,从而通过单一模型实现视频预测、4D重建和视觉规划。
4.4. 视频-行动联合训练
视频-行动联合训练范式可以同时预测未来的观测结果和行动。这类方法通过多任务学习的方式实现,使模型能够更好地学习视频与行动之间的对应关系,从而提升预测性能。其核心设计是一个共享的潜在空间,视觉和行动特征通过各自的编码器投影到该空间,然后由独立的扩散或自回归头进行解码。
HMA [107]引入了异构预训练(HPT),将来自不同机器人形态的行动映射到通用嵌入中,并采用掩码自回归,使同一Transformer参数同时预测下一帧和下一关节角度。UVA [61]提出了对称编码器后接解耦扩散头:一个头合成视频,另一个头回归连续行动,同时通过掩码调度灵活地在重建、预测和纯行动生成目标之间切换。WorldVLA [12]用三个编码器(图像、文本、行动)输入联合潜在空间来实例化该范式;一个世界模型头根据行动头预测的控制信号渲染未来观测。
4.5. 基于强化学习的训练
在过去一段时间里,越来越多的研究者开始利用强化学习框架来训练LLM和VLM,以增强大模型在处理边缘案例时的理解和推理能力。于是,一个自然的问题随之而来:我们能否用强化学习的方法来训练世界模型?
RLVR-World [116]首次将基于强化学习的训练范式引入世界模型,并使用视频生成质量的度量指标作为奖励。它将世界模型本身构造为一个自回归策略,其行动是下一段潜在状态令牌序列,并直接使用LPIPS等视觉指标作为奖励来优化世界模型。其成功表明,强化学习确实能够塑造世界模型的动态,使其更有利于下游应用,而不会导致生成保真度的灾难性遗忘。
基于这些早期的成功结果,下一个研究前沿在于使奖励机制不仅能够略微提升视频生成质量。我们期望它具有潜力成为控制行为可控性的主要指标,并可能更好地引导世界模型遵循物理规律。基于强化学习的训练方法塑造了底层的动态机制,使连续关节角度的微小变化能够转化为可靠且符合物理逻辑的未来结果。
5. 具身世界模型的应用
近期在架构设计和训练范式方面的改进,极大地推动了具身世界模型的发展,展现了其广泛应用的广阔前景。这些模型学习从数据中模拟物理世界的动态,为机器人领域中几个长期存在的挑战提供了强大的解决方案。本节将介绍具身世界模型在四个领域中的应用动机、实现方式及优势:1)机器人数据生成,2)强化学习环境模拟,3)机器人策略评估,以及4)智能体行动规划,如图11所示。具身世界模型应用方面的代表性工作列于表5中。
6. 具身世界模型的基准测试
具身世界模型的基准测试旨在评估生成模型是否不仅能够作为视觉合成器,还能作为物理和交互环境的可靠模拟器。
与强调视觉保真度或语言对齐的传统视频生成评估指标不同,该领域的基准测试必须涵盖对具身智能至关重要的维度,包括物理合理性、任务执行、策略评估和数据可扩展性。为了对这一领域进行系统梳理,我们从四个互补的角度进行回顾。第一个角度考察生成数据的质量,将保真度重新定义为融合感知、语义和物理一致性的多维概念。第二个角度将重点转向端到端的操作评估,即评估世界模型作为能够生成有效行动轨迹的规划器的能力。第三个角度关注评估的可靠性,探究基于世界模型的评估是否能够可靠地预测真实世界中的策略性能。最后一个角度从数据规模化的视角出发,衡量合成推演在多大程度上支持高效、可泛化和可迁移的策略学习。这些基准共同构成了一个系统性框架,用于评估具身世界模型——既作为物理基础数据的生成器,也作为具身决策的使能器。代表性工作及相关指标总结于表6中。
6.1. 生成数据质量
在评估具身世界模型时,生成数据的质量是一个核心前提,因为只有视觉上令人信服、语义上忠实且物理上连贯的视频,才能为推理和控制提供可靠的支撑。近期的基准测试将数据质量重新定义为一种多维构念,而非单一分数。VBench [51]引入了16个解耦维度,将感知视频质量(时序平滑性、主体一致性、美观性)与文本提示的条件一致性(语义保真度、空间关系、风格)区分开来。T2V-CompBench [94]将此视角扩展到时空组合性,通过多模态语言模型、检测方法和运动追踪,评估动态属性绑定、运动和动作绑定、交互以及计数能力。VBench-2.0 [136]通过关注内在忠实性,利用VLM-LLM对齐、基于视频的问答和异常检测等混合流程,衡量人类保真度、创造力、可控性、物理规律和常识,进一步推动了该领域的发展。总体而言,这些工作勾勒出一条从表面保真度到组合连贯性,再到内在世界忠实性的演进路径,表明数据质量必须融合感知、语义和物理一致性等多个维度,才能支撑具身智能。
在这一演进过程中,遵守物理规律已成为一个尤为关键的维度,因为只有物理上合理的视频才能支撑可靠的推理和控制。VideoPhy [5]首先通过人类对物质交互中常识合理性的判断将这一问题凸显出来,而VideoPhy-2 [6]则将评估扩展到体育和物体交互场景,引入了重力、动量守恒等物理规律的规则级标注,并配合从人类反馈中提炼的自动评估器。PhyGenBench [77]通过将提示与27条物理规律相关联,建立了一种基于规律的评估范式,并引入了一个三层框架,通过视觉-语言模型评估现象识别、时序顺序和自然性。WorldModelBench [60]将此视角扩展到机器人、自动驾驶等应用驱动领域,整合了指令遵循、常识和细粒度物理遵循类别。最后,EWMBench [129]专注于机器人操作中具身世界模型的评估,结合了场景一致性、基于轨迹的运动正确性以及与任务指令的语义对齐。综合来看,这些基准测试描绘了一条从直观合理性到显式规律测试,再到特定任务具身设置的演进轨迹,使物理评估成为生成数据质量的一个系统性支柱。
6.2. 端到端操作评估
对行动规划准确性的评估并非将世界模型视为训练环境,而是将其视为智能体本身。核心问题在于模型是否能够预测行动的结果,并生成有效实现指定目标的轨迹。这评估了模型的决策能力和长时程规划能力。图12展示了这一基准测试的工作流程,其中世界模型本身充当规划器来生成轨迹,并将生成的推演结果与真实参考进行对比评估。
近期,大规模自监督方法进一步推动了规划准确性的前沿。V-JEPA 2 [3]利用互联网规模的视频预训练来学习物理动态的预测表示,并仅用约62小时的机器人交互数据,微调了一个行动条件化模块,该模块支持零样本机器人规划。该模型在未见过的环境中对Franka机械臂执行了拾放操作,且无需任务特定奖励,这突显了评估零样本规划成功率的基准价值。
在算法进展之外,WorldSimBench [84]提供了首个明确将世界模型作为规划器进行评测的基准框架。其隐式操作评估(衡量生成的视频是否能一致地转化为正确的行动)在三个具身领域测试模型:开放环境(Minecraft)、自动驾驶和机器人操作。这为衡量世界模型的想象推演是否与可执行的控制序列对齐,提供了一种原则性方法。
在这一视角下,世界模型被当作规划智能体来评判,基准测试强调决策质量、推演保真度,以及生成能够直接转化为成功具身行动的轨迹的能力。
6.3. 面向策略模型的评估可靠性
评估可靠性关注的是,具身世界模型能否提供对真实世界结果具有预测性的策略评估。这一维度并非仅关注感知保真度,而是考察基于世界模型评估所获得的指标,是否能作为机器人实际表现的可靠指标,从而缩小长期存在的模拟到现实差距。图13展示了该基准的运作方式:将世界模型中进行的策略评估与真实世界执行中获得的评估进行对比,重点关注相关性、排序稳定性和偏差分析。
近期的工作突显了提升评估可靠性的若干策略。一方面,Quevedo等人[85]提出了基于世界模型的策略评估(WPE),其中行动条件视频生成模型充当策略测试的代理。通过比较在相同行动序列下生成的推演与真实机器人执行结果,WPE提出了基于像素级相似度、感知分数和语义分割的评估指标。实证结果表明,WPE倾向于低估分布内策略,而高估分布外策略,但能够一致地保持策略的相对排序。这表明,即使在真实世界测试昂贵或具有风险时,不完美的世界模型也能作为可靠的部署前评估器。
在此基础上,Li等人[62]提出了WorldEval,这是一个自动化框架,通过Policy2Vec(直接从策略网络派生的潜在行动表示)将视频生成模型转变为策略评估器。通过将这些策略特定的嵌入注入预训练视频模型,WorldEval生成了遵循策略的视频,从而揭示底层控制器的质量。在多个操作任务上的实验表明,WorldEval与真实世界成功率实现了强相关性,皮尔逊相关系数超过0.94,并具有稳定的排序一致性。此外,WorldEval还扩展到了安全检测领域,因为崩溃或不安全的策略会产生不现实或退化的视频输出,从而能够在部署前及早发现危险行为。
另一方面,Shang等人[93]提出了RoboScape,这是一个物理信息驱动的具身世界模型,通过时序深度预测和自适应关键点动态学习来增强视频生成。通过在训练过程中融入几何和运动约束,RoboScape解决了纯RGB模型常见的失效模式,例如不合理的物体变形或不连续的运动。实验表明,RoboScape不仅改善了视觉和物理保真度,还在策略评估中与真实模拟器实现了高度对齐,皮尔逊相关系数超过0.95。这突显了嵌入物理先验以确保评估可靠性的重要性。
综合来看,这些研究表明,可靠的策略评估不能仅靠表面级的视觉质量来实现。相反,基准测试必须同时评估策略排序的稳定性以及生成的推演在多大程度上遵循物理约束。展望未来,评估协议应将排序一致性、皮尔逊相关性和偏差分析(低估与高估)与物理感知建模目标相结合。这些实践将有助于确保具身世界模型不仅在视觉上令人信服,而且作为机器人策略的评估器也是值得信赖的。
6.4. 下游策略模型中的数据规模化
评估具身世界模型的另一个关键视角是它们扩展策略学习的能力。在此设定中,世界模型被视为替代环境或数据生成器,其效用反映在随着生成数据规模增长而带来的样本效率、泛化能力和适应性的提升上。图14描绘了基准测试如何评估数据规模化的影响,即世界模型生成不同大小的数据集来训练下游策略,并衡量效率、泛化能力和可迁移性方面的提升。
近期进展展示了数据规模化通过多种途径提升下游策略性能。一个代表性方向是将可控视频世界模型用于机器人数据增强。Jang等人提出了DreamGen [52],利用生成式视频模型产生多样化且物理合理的推演结果,使智能体能够获得跨任务和跨环境泛化的稳健策略。在此基础上,RoboTransfer [67]引入了一种几何一致的视频扩散模型,以改善模拟到现实的迁移,从而在实际机器人部署中获得更高的成功率。除了轨迹增强之外,世界模型还被用作任务生成器。GenSim [106]利用大语言模型合成新的机器人任务和模拟场景,从而拓宽训练分布并提高在未知条件下的鲁棒性。
另一条研究路线探索多模态和语言增强的世界模型。WorldGPT [32]将大语言模型与多模态场景表示对齐,使智能体不仅能在感知层面受益于世界模型,还能在任务语义推理方面获益。在轨迹中心领域,Traj-LLM [58]表明,语言预训练模型可以增强世界模型以进行轨迹预测,从而辅助规划模块获得更准确且更具泛化能力的策略。此外,RoboScape [93]表明,在推演中嵌入物理先验在扩展到机器人策略学习时,既能提高样本效率也能增强可迁移性。
总之,数据规模化是评估具身世界模型的一个严谨视角:一个模型能否有效利用大规模合成或多模态数据来加速学习、增强泛化并促进部署,决定了其实际价值。然而,确保持规模化后的数据遵循物理规律、避免分布坍塌、并在多样性与保真度之间取得平衡,仍然是尚待解决的挑战。
7. 挑战与未来工作
7.1. 有效的数据收集
人工智能中的生成式世界模型是学习模拟和预测现实世界动态的系统,常用于强化学习、机器人或视频生成等领域。然而,为训练世界模型本身而进行的数据收集同样是一个相当大的挑战。尽管互联网视频数量极其庞大,但其中专门针对具身任务的视频很少,因此在训练世界模型时难以使用[45]。核心问题在于缺乏与机器人相关的高质量、面向具身任务的数据,这类模型需要序列化的、以行动为条件的数据集,以捕捉物理交互、感觉运动反馈和环境转移——这些要素在现实环境中收集成本高昂且劳动密集,往往导致数据集规模比语言或视觉模型所用的数据集小几个数量级(例如,数万小时对比数十亿小时)[68]。训练数据中的偏差和代表性不足进一步加剧了挑战,因为往往来自有限来源的有偏数据集可能导致不公平的结果,或无法覆盖多样化的场景,从而限制了跨机器人领域的适应性[82]。也就是说,数据收集仍然是未来构建更好、更强具身世界模型的主要方向。
7.2. 有效的架构设计与因果训练
为具身机器人构建生成式世界模型的另一个重大挑战在于设计有效的架构,并融入因果训练——即构建神经网络以学习和表示因果关系,而非仅停留在统计相关性层面,从而使模型能够预测动态物理环境中干预和反事实情景的结果。应对这一挑战的潜在方法包括以下几个方面。首先,我们可以将因果结构直接纳入模型架构中。例如,在运动规划中采用因果Transformer [76](如带有因果掩码)进行序列推理,在嵌入因果先验的同时聚焦于相关特征,可能会提升其效用。其次,一些融合生成与行动的混合架构也颇具前景。例如,通过构建模块化的VLA或基于JEPA的规划器,以提示为条件进行潜在预测,可以实现可微分的规划和轨迹的因果模拟。第三,因果关系实际上是一种物理规则,因此嵌入物理规律的方法也是一种潜在的解决方案。例如,最近的一项工作[93]将物理先验嵌入生成模型,用于联合RGB视频生成和物理预测,采用统一架构确保因果一致性。总之,在因果架构、混合模块、物理规律等方面进行更多探索是很有前景的。
7.3. 有效的基准构建
当前具身世界模型研究的另一个局限性在于缺乏有效的基准构建——即缺少全面、标准化的评估框架,专门用于评估生成式世界模型在具身AI系统中的独特能力和需求,例如在机器人领域中用于模拟真实世界动态、预测行动结果和实现长时程规划等场景[122]。这一挑战源于现有基准测试往往聚焦于视觉感知或基础导航等狭窄方面,未能全面评估物理真实性、运动动态、与任务的语义对齐、因果推理以及跨多样化环境的泛化能力等关键要素,导致模型之间难以进行一致的比较,也阻碍了识别真正进展或不足的进程。为解决这一问题,有一些有前景的未来方向。首先,弥合仿真与真实部署之间的差距至关重要。这需要开发更易用且广泛使用的仿真到现实工具包和系统,例如构建具有高保真数字孪生和物理引擎的基准测试[14]。其次,对于具身任务本身而言,评估方式已经非常多样化,导致对具身世界模型存在多种评估方法。研究人员应基于支撑具身智能体的关键能力来定义具身世界模型的评估指标,而非从基于AI的内容生成视角出发[21]。第三,引入更多结合LLM/VLM与传统方法的具身智能体[30],使其能够自主与仿真引擎和生成式世界模型交互以收集基准数据,是一个有前景的方向。这些智能体应具备自适应策略,以检测现有具身世界模型的弱点,并在数据收集过程中考虑更多边缘案例。总之,未来的工作应更多考虑仿真到现实差距、基于任务的评估、自主收集等方面。
7.4. 与大语言模型的关系
大模型的进步是当前具身智能发展的关键催化剂,早期工作已经展示了基于LLM内部世界模型的具身推理和任务求解能力[50]。尽管当前具身世界模型的研究主要聚焦于生成视角[64,69,72],但从理解为中心的角度增强其能力已成为同样关键的方向[20]。这一需求的必要性尤其体现在以下发现上:许多现有的多模态大语言模型在细粒度视觉理解和空间推理等核心能力上存在显著缺陷[105,109]。因此,如何有效提升这些模型的空间理解和推理能力[110],以及如何将这些理解能力的进步转化为生成性能的实质性提升[66],已成为关键的开放性问题。解决这些问题将有助于直接推动具身世界模型的进步。
7.5. 现实世界部署与应用
具身世界模型的现实世界部署和应用是技术发展中一个关键但相对被忽视的方面,其中安全性、泛化能力和效率方面的关键挑战是其成熟和实际应用的主要瓶颈。在安全性方面,当前模型通常充当黑箱控制器[64,69,72],难以在极端或异常情况下确保可靠性;因此,研究有效的安全策略以构建内在安全的具身世界模型是一个至关重要的研究方向。在泛化能力方面,现有模型的表现仍然明显不足,严重依赖于训练数据的多样性[82]。虽然收集更多样化的数据是一个可行的短期策略,但长期解决方案在于开发稳健的学习机制,使模型能够掌握基本原理以实现真正的泛化。在效率方面,对大型模型的依赖导致参数量过大、推理效率低、运营成本高且延迟不可接受,因此必须大幅提高其生成和推理速度,使其具备实用性和广泛部署的可能性。
7.6. 迈向通用且跨尺度的物理世界模型
虽然当前世界模型已在游戏等虚拟领域[4,35]中得到了重要应用,并在自动驾驶[78,134]和具身智能[91,93,133]等现实场景中逐渐受到关注,但该领域仍然支离破碎,不同领域的世界模型在很大程度上相互独立。这对实现通用模型构成了重大挑战。例如,驾驶世界模型主要关注大规模动态和外部环境变化,而具身世界模型则强调物体操作的细粒度细节。另一个关键挑战在于行动控制格式的异质性。不同的世界模型需要不同类型的行为指令,包括文本命令[1]、运动轨迹[7]和离散关节状态[93]。统一这些多样化的行动空间以控制单个生成模型,是一个具有挑战性的研究问题。展望未来,我们的目标是开发一个领域无关的物理世界模型,能够生成和模拟从大规模运动到细粒度操作的不同场景。这样的模型将是向着能够理解并与我们复杂的多尺度世界交互的通用具身智能迈出的重要一步。
8. 结论
在本综述中,我们系统回顾了具身世界模型的快速发展,该领域对于通用人工智能的未来至关重要。为了驾驭这一复杂领域,我们提出了一种新颖的技术分类体系,提供了一个清晰、结构化的框架。该框架从四个核心维度对领域进行组织:模型架构、训练方法、应用场景和评估方式。我们首先详细介绍了基于视觉的生成式世界模型及其潜在空间对应模型,以及相应的不同训练范式。随后,我们探讨了它们多样化的应用场景,从作为可扩展的云模拟器到充当设备端机器人大脑。我们还总结了有效基准测试的关键评估维度。最终,本综述将复杂的研究提炼为一份清晰、易于导航的指南。最后,我们概述了关键挑战和有前景的未来方向,希望能激发这一重要领域的进一步创新。
原文链接:https://www.preprints.org/frontend/manuscript/97505e9c3d2227bb313252975283b11c/download_pub
热门跟贴