来源:市场资讯
(来源:苏子淳 中国建投)
中国建投原创文章
中国建投子公司——建投投资/建投华文
作者:苏子淳
本文5070字,阅读时间13分钟
7月,世界人工智能大会上,“物理AI和具身智能”成为全场焦点;几乎同期,工信部等七部门联合启动创新任务揭榜挂帅,明确要求“研制具有自主知识产权的端侧世界模型系统”。政策信号密集指向同一个判断:具身智能的竞争要害在“脑”,不在“身”。
资本市场的反应同样迅速。据IT桔子数据,2026年上半年国内具身智能赛道融资总额达935亿元,较2025年同期增长超过5倍。产量决定下限,“大脑”决定天花板,已成行业共识。
然而,一个根本性的技术问题尚未解决:如何让机器真正理解物理世界的运行规律,而不仅仅是“看到”世界? 这正是世界模型试图回答的问题。从感知到推演,从识别环境到预测未来——世界模型能否成为具身智能的下一个范式突破?本文将从概念界定、技术路线、发展阶段、应用场景与产业化前景五个维度,尝试梳理这一命题的基本逻辑。
一
世界模型概念定义
01
概念界定:什么是世界模型
世界模型尚无业界统一的标准定义。NVIDIA给出的定义为:世界模型是理解现实世界动态(包括物理属性和空间属性)的生成式AI模型,能够通过文本、图像、视频和运动等输入数据来生成或模拟物理环境,并对运动、应力、空间关系等动态进行表示和预测。
从更技术化的表述来看,世界模型可以被理解为一个交互式预测系统:给定当前状态(观测)和将要执行的动作,预测下一个状态(观测)。标准视频模型的预测范式为P(x(t+1) | x(t)),即基于当前帧预测下一帧;而世界模型的预测范式为P(s(t+1) | s(t), a(t)),即在给定当前状态和动作条件下预测下一状态。其中的"动作"项,是世界模型与视频生成模型在数学表述上的本质差异。
世界模型的核心能力体现在两个层面:
第一,对世界运行规律的建模。模型通过海量观测数据(以视频为主)提炼物理规律(如重力、摩擦力、碰撞反弹)、社会规则(如交通规则、交互礼仪)和因果关系(如刹车导致减速),形成一套可复用的世界逻辑。
第二,预测与推演能力。模型能够模拟未来可能发生的情景,评估不同行动方案的潜在结果,并选择最优策略实现目标。这一能力通常被称为"反事实推理",即"如果我采取A而非B,结果将如何不同"。
需要指出的是,世界模型并非全新概念。其思想根脉可追溯到1990年代强化学习领域对世界内部表征的研究。2018年,Ha与Schmidhuber的论文《World Models》正式为该领域命名。此后,经过2019年MuZero、2023年Dreamer V3、2025年V-JEPA 2等一系列技术迭代,世界模型逐步从游戏环境仿真走向物理世界应用。这一概念自提出至今已近三十年,当前的热度更多是技术积累与产业需求交汇的产物,而非突然涌现的全新方向。
02
世界模型与大语言模型的差异
世界模型与大语言模型(LLM)的区别,本质上是"物理预测"与"语言推理"两种能力路径的差异。
大语言模型的核心范式是“下一个词预测”,其训练数据为人类文本语料,核心能力体现在语言理解、知识组织、逻辑推理与符号操作。它回答的问题是:基于已有文本,最可能出现的下一个词是什么?
世界模型的核心范式是“下一个状态预测",其训练数据为视频、传感器信号、动作轨迹等多模态序列,核心能力体现在物理规律理解、空间推理、因果推演与行动规划。它回答的问题是:基于当前状态和将要执行的动作,世界将发生何种变化?
两者的差异可从以下维度对比:
大语言模型编码了大量关于世界的因果和物理知识(体现在语言对物理概念的描述中),但这些知识来自符号表征而非直接体验。世界模型则试图通过对物理世界数据的直接学习,建立对运动、力、空间关系的内在理解。两者并非替代关系,而是互补关系——前者负责理解意图与组织知识,后者负责预测物理后果与规划行动。当前最前沿的研究方向之一,正是将两者的能力进行融合。
二
世界模型发展阶段
世界模型的发展历程大致可分为两个主要阶段:
第一阶段(2018年—2024年):表征学习阶段。这一阶段以"表征派"为主,研究重心聚焦环境感知与状态预测,旨在弥补语言模型在物理与因果建模方面的能力缺口。代表性成果包括2018年《World Models》提出的V-M-C三组件架构、2019年MuZero在潜空间中的规划、2022年DreamerV2在Atari游戏上达到人类水平等。这一阶段的世界模型主要应用于游戏和虚拟环境,真实物理世界的应用探索仍处于早期。
第二阶段(2025年至今):生成与交互阶段。2025年后,产业研究重心开始向"生成派"倾斜。Genie 3、Marble、Sora 2等代表性成果标志着世界模型已具备生成持续存在物体、模拟因果逻辑与动态环境的能力。在自动驾驶领域,Wayve的GAIA-2、华为WEWA架构已将世界模型应用于真实驾驶场景的数据生成与策略训练;在机器人领域,Meta的V-JEPA 2、极佳视界的GigaBrain等成果验证了世界模型在真实机械臂上的部署可行性。行业已基本形成共识:视频生成是世界模型的雏形,两者在技术演进上将进一步重合。
当前,世界模型的发展阶段可类比于大语言模型的GPT-1至GPT-2时期——技术方向已获初步验证,产业共识正在形成,但模型架构、训练方法和应用场景均未收敛,头部玩家的技术路线存在显著差异。
从政策环境看,世界模型已纳入国家级产业规划。2025年12月,中国信通院牵头的世界模型技术报告在国际电信联盟成功立项。2026年《政府工作报告》明确提出"培育发展具身智能等未来产业",《十五五规划纲要》将人工智能置于创新驱动发展核心位置,各地陆续出台具身智能专项扶持政策,竞相提出百亿乃至千亿级产业发展目标。政策面的系统性支持,为行业提供了明确的中长期发展牵引。
三
世界模型技术路线
世界模型领域目前存在四条并行探索的技术路线,每条路线基于不同的哲学假设,适用于不同的下游场景。
01
视频生成路线
该路线的核心假设为:如果一个模型能够生成符合物理规律的视频,则其必然已内化了支配物理世界的基本规律。代表系统包括OpenAI的Sora、Google DeepMind的Genie 3、NVIDIA的Cosmos等。
该路线的优势在于数据规模庞大(互联网视频几乎取之不尽)、训练目标直观、结果可视化程度高。但其局限同样显著:计算成本极高,单次训练耗资可达数千万美元;长时序生成易出现物理逻辑漂移;模型仍时常产生违背物理常识的"幻觉"现象。此外,纯视频生成本质上是"被动观看"而非"主动交互"——模型能预测场景如何演化,但无法对干预动作做出实时响应。当前,该路线的主要应用集中在数据合成、场景仿真和内容生成领域。
NVIDIA的Cosmos是该路线在工业界最具代表性的平台化尝试。其基于2000万小时真实世界数据训练,不只是一个模型,而是包含视频生成、仿真到真实迁移、物理推理和机器人训练工具的完整平台。对产业界而言,平台化意味着算法贡献可以落到视频生成、多模态理解、物理仿真、机器人数据生成等多个模块,具有更强的工程落地价值。
02
3D空间智能路线
该路线试图直接生成持久、稳定的三维环境,而非二维视频帧。代表为李飞飞团队发布的Marble系统,可将单张图片转化为可交互的三维场景。
与视频模型的"隐式物理直觉"不同,3D路线生成的是显式结构——模型明确知道每个物体的空间位置、形状和相互关系,这使得物理模拟、路径规划和动作控制等下游任务更易于实现。但该路线的技术难度远高于2D视频生成,对算力需求巨大,且高质量3D训练数据极为稀缺。目前,3D空间智能仍主要停留在场景浏览和静态环境生成阶段,完全的交互性和物理模拟仍是未来方向。
03
联合嵌入预测路线
该路线由图灵奖得主杨立昆长期推动,核心主张为:生成每一个像素是对计算资源的浪费,真正的智能应当像人类一样,只需预测事物的抽象特征,无需将世界完整"画"出来。
JEPA(Joint-Embedding Predictive Architecture)架构在抽象的表征空间(latent space)而非像素空间中进行预测。例如,面对一个运动的物体,模型不会预测每个像素的RGB值,而是预测其轨迹、速度等高层次语义信息。这种机制通过主动忽略不可预测的细粒度信息(如光照变化、纹理抖动),提升了计算效率和对物理本质的聚焦。
Meta发布的V-JEPA 2是该路线在工业界的重要代表。其在超过一百万小时视频数据上自监督预训练,全程不生成像素,仅在潜空间中规划和预测。实验表明,V-JEPA 2在真实机械臂上完成抓取和放置任务时,规划速度比像素级方法快数十倍。对于关注表征学习、物理理解和机器人规划效率的研究者而言,这是一条更"经济"的技术路径。
04
世界行动模型路线
该路线进一步将视频理解、世界预测和动作生成统一在一个模型中,输出的不仅是未来状态,还包括具体的行动指令。代表包括Motus、DreamZero以及极佳视界的GigaBrain等。
传统的视觉-语言-动作模型(VLA)能够将视觉和语言映射为动作,但本质上是一个"黑箱"映射系统,不建模环境内部的动力学,泛化能力受限于训练数据的覆盖范围。世界行动模型(WAM)则试图让模型同时学习"世界如何变化"和"我应该如何行动",用视频作为稠密的物理监督信号,使动作决策建立在对物理规律的真正理解之上。
目前,这四条路线在学术界和工业界并行推进,尚未出现收敛迹象。但从逻辑推演来看,其长期终点可能是一个统一架构:既能渲染高保真视觉内容,又能生成物理精确的世界结构,还能规划复杂行动序列,并根据下游任务需求在不同输出模态之间自由切换。如何将视觉美感、物理精确性和行动可控性在同一个模型中协调,仍是当前最核心的开放性问题。
四
世界模型产业化应用
世界模型的产业化应用,目前主要集中在三类需要"理解物理、预测未来、做出决策"的领域。
01
自动驾驶
传统自动驾驶架构分为感知、预测、规划、控制四个模块,存在信息逐级丢失、长尾场景覆盖不足、仿真数据与真实场景差距大(Sim-to-Real Gap)等问题。世界模型提供了两条新的解决路径。
一方面,世界模型可生成大量自带标注的仿真数据,包括极端天气、罕见路况、危险驾驶行为等长尾场景,避免昂贵的真实数据采集。据业内测算,采用世界模型进行仿真训练,数据成本可降低90%以上。另一方面,世界模型使系统从"识别当前环境"进化到"推演未来场景"——如果能够预测未来5至10秒的交通动态演化,车辆便可做出更前瞻、更安全的决策。
据弗若斯特沙利文《2025年中国世界模型发展白皮书》,当前超过80%的自动驾驶算法已使用世界模型进行辅助训练,多家主流厂商已将世界模型视为下一代智能驾驶架构的核心。白皮书预计,未来1至2年内,世界模型的成熟将引领自动驾驶迎来新一轮突破。
02
具身智能
机器人领域可能是世界模型最具长期价值的应用方向。传统机器人依赖预编程指令,遇到训练数据未覆盖的新场景往往失效。世界模型赋予机器人对物理世界的理解与预测能力,使其能够在新环境中自适应、泛化执行。
当前,通用机器人发展的核心瓶颈是训练数据。与语言模型可调用海量互联网文本不同,机器人需要在真实物理环境中采集操作数据,积累速度极为缓慢。据公开数据,特斯拉约40台机器人每月仅采集16至20万条数据,DeepMind用13台机器人历时17个月才积累约200万条数据。世界模型通过虚拟仿真生成海量训练数据,让机器人在"梦境"中反复练习后再迁移到真实环境,是解决数据瓶颈的关键路径。
03
内容工业与数字孪生
在影视、游戏、广告等内容产业,世界模型正在重塑生产范式。其核心应用包括:生成具备物理一致性的连续视频、可交互的三维场景、符合物理规律的特效画面。在数字孪生领域,世界模型提供了一种超越视觉可信度、具备物理精确性的模拟环境。据NVIDIA估计,仅数字孪生相关的目标市场就超过万亿美元,涵盖工厂、仓库、供应链和工程设计等场景。
五
行业分析及趋势判断
世界模型的热度正在快速转化为资本行动。据Gartner预测,2026年全球世界模型相关市场规模将突破50亿美元;摩根士丹利更为激进地预测,到2035年,由世界模型赋能的产业规模将达到10万亿美元。
国内方面,头部创业公司在不同技术路线上持续产出成果。但整体而言,行业尚处发展初期,技术路线多元分化,商业化仍以场景验证和早期订单为主,尚未形成绝对领先者。国内竞争格局呈现“技术路线百花齐放、资本加速涌入头部初创"的特征。
当前世界模型赛道正处于类似大语言模型GPT-1至GPT-2的关键节点:技术方向已获验证,产业共识正在形成,但路线尚未收敛、格局尚未固化。这意味着赛道兼具高成长潜力与较高的技术和商业不确定性。
需要关注的风险包括:一是技术路线未收敛,视频生成、3D重建、隐空间预测、世界行动模型四条路线并存,最终何种架构胜出尚无定论;二是数据供给不均衡,互联网视频数据充裕,但高质量三维资产和机器人示范数据长期稀缺,可能制约模拟器和规划器方向的进展;三是商业化节奏存在不确定性,物理AI的规模化应用(如家庭服务机器人)可能晚于市场预期。
世界模型的终局,不会是某一家公司或某一条技术路线的独舞,而是渲染、模拟、规划三条路径逐步融合后的统一架构。那个能够同时感知、理解和行动的AI系统,或许才是通向通用人工智能的关键基础设施。
文章为作者独立观点,不代表中国建投立场。
图片来源:unsplash.com/pexels.com
热门跟贴