日前,第六届“雨前论坛”暨产业研究专业能力竞赛圆满落幕。本届论坛以“2035四川何为”为主题,聚焦数字经济、电子信息、医药能源、装备制造四大核心领域,围绕人形机器人、氢燃料电池、低空经济、商业航天、先进封装等29项前沿议题展开研讨。现将论坛成果整理为系列文章,分期发布。本篇为第十期,欢迎持续关注。
作者:雨前顾问数字经济研究部产业分析师 张文梓伊
过去三年,大模型几乎定义了人工智能的主航道。但进入2025—2026年,全球人工智能前沿研究开始出现新的重心:从“模型掌握多少知识、生成何种内容”,进一步迈向“模型能否理解现实世界、预测环境变化并据此作出行动”。
杨立昆离开Meta创办AMI Labs,目标是研发能够理解物理世界、记忆、推理和规划的“世界模型”;强化学习奠基人Richard Sutton与David Silver提出“经验时代”,认为下一阶段AI将越来越依靠与环境互动形成自身经验;李飞飞则创办World Labs直接押注“空间智能”,并于9月推出可统一处理文本、图像、视频和3D信息的Atlas世界模型。路线虽不同,却共同指向一个问题:仅靠预测下一个词,能否通往真正能够行动的智能?
一、大模型之后,大家为何开始押注世界模型?
理解这一轮技术转向,首先要区分大语言模型和世界模型。大语言模型本质是根据上下文预测下一个Token,擅长回答“接下来应该说什么”;而世界模型则试图预测“采取某个行动后,世界会发生什么”,核心是建模环境状态、变化规律和行动后果。例如,真实世界里机器人拿起水杯,不仅要识别“这是杯子”,还要判断位置、抓取方式、力度,以及动作之后杯子会如何移动。
图1 大语言模型与世界模型对比
世界模型存在三大不可替代价值:
一是提升样本效率——让AI在“脑子里练一万遍”。机器人、自动驾驶等Physical AI的数据采集成本高、速度慢,许多动作和极端场景更难在现实中反复尝试。世界模型可基于有限真实数据构建可模拟环境,让智能体先在虚拟世界中反复训练、试错,再进入现实执行,把有限真实经验转化为可重复利用的虚拟经验。
二是增强规划能力——让AI在动手之前先“算一遍”。现实任务往往需要比较多种行动路径及其后果。世界模型可以在内部推演“A、B、C不同动作分别会发生什么”,再据此选择行动方案,使AI从即时反应进一步走向多步规划和决策。
三是提高安全性——让高风险场景先在虚拟世界中发生。极端天气、设备故障、突然横穿的行人等低概率高风险事件既难采集,也不适合在现实中人为制造。世界模型可以生成反事实和长尾场景,用于压力测试与安全验证;在工业控制中,也可提前模拟设备故障、异常工况和控制失效等情形,减少真实系统中的试错风险。
为何世界模型在最近两年迅速升温?
关键在于几项过去相对独立的技术开始汇合。一是视频和多模态模型能力显著提升。从Sora、Veo到Genie、Cosmos,模型对动态场景的生成、预测和时序一致性明显增强,为世界模型从早期概念验证逐步具备构建可持续演化环境的技术基础。二是具身智能真实场景落地遭遇数据瓶颈。机器人训练所需的操作、交互和动作数据获取成本高、采集速度慢,且跨任务、跨环境复用有限,真实数据供给逐渐成为规模化训练的重要约束。三是自动驾驶等产业开始跑通“反事实仿真”的商业闭环。部分企业已将世界模型用于复杂交通场景生成、闭环仿真和系统验证,以更低成本覆盖真实道路中难以大量采集的边缘场景,使世界模型从研究工具逐步转化为可进入研发流程、产生实际经济价值的工程能力。
二、世界模型有哪些路线?
目前世界模型尚未形成统一技术范式,大致可分为四条路线。
一是杨立昆代表的抽象表征路线。JEPA不追求逐像素预测,而是在潜在空间预测关键状态和结构。V-JEPA 2已将这一思想从视频理解推向机器人规划。认为人看到一个球从桌边掉下,不需要预测每束光、每个像素如何变化,只要掌握“球—桌面—重力—运动”之间的关系即可。
二是李飞飞代表的空间智能路线。World Labs强调生成持久、一致、可探索的3D世界。2026年9月发布的Atlas可原生处理文本、图片、视频和3D,并将这些信息置于统一空间上下文中,同时把能力从“生成3D内容”扩展到机器人Real-to-Sim,只需少量手机拍摄,就可以重建真实环境,再模拟机器人在其中导航、操作物体时看到什么。
三是Sutton等强化学习研究者代表的具身控制路线。核心不是“把世界画出来”,而是学习“采取不同动作后,环境会如何变化”。智能体通过真实交互学习环境规律,再利用内部模型推演不同动作的结果,为规划、决策和长期自主学习提供内部“沙盘”。
四是以Google DeepMind等为代表的视频生成式路线。这一路线由视频生成能力演进而来,目标已从生成逼真视频转向构建能够持续演化、响应动作并支持交互的动态环境,为机器人、自动驾驶和通用智能体提供新的训练环境。
图2 四条技术路线对比
总体来看,四条路线关注的重点分别是“如何抽象世界”“如何理解空间”“如何预测行动后果”“如何生成可交互世界”,它们切入点不同,但最终都在逼近同一个目标——让AI不只是识别和描述世界,而是能够建立内部世界模型,并据此预测和行动。
三、世界模型是AI的正确答案吗?
世界模型能否成为下一代AI的核心路径,目前仍存在明显分歧。
一种观点认为,世界模型是AI进入物理世界的重要基础。仅依赖语言数据训练,难以充分形成对空间、时间、物体关系和物理规律的理解,而观察、行动及对 行动后果的持续学习,是现实世界智能的重要来源。另一种观点则认为,世界模型并非取代大语言模型,而是补充其能力边界;更可能的路径,是将语言模型与视觉感知、空间智能、世界模型、强化学习和机器人控制结合 ,形成多模型协同体系。
同时也应看到,世界模型距离大规模产业应用仍存在较高门槛。现实世界视频、3D、传感器和动作数据规模大、成本高,并具有较强长尾性和不确定性。世界模型不仅要生成“看起来合理”的结果,更需要保证物理规律、因果关系和长期预测具有较高可靠性,对数据、算力、传感器、算法和评测体系均提出更高要求。
图3 “世界模型是AI的正确答案吗?”主流观点
未来,AI或将形成“语言理解—多模态感知—世界建模—规划决策—行动控制”的协同架构:大语言模型承担知识理解、交互和推理,世界模型刻画环境状态及其演化规律,行动模型将判断转化为具体决策与执行,并通过真实世界反馈持续迭代。因此世界模型未必是AI唯一的“正确答案”,但或将是下一阶段AI走向真实世界的关键拼图。
四、四川机遇
四川发展世界模型,不宜简单追求通用基础模型“大而全”,应立足产业基础、复杂地理环境和特色应用场景,重点将真实场景、动作数据和仿真验证能力转化为竞争优势。
一是建设矿山复杂工业环境世界模型试验场。依托攀西矿区、川南煤矿等场景,推动矿山、装备、机器人和人工智能企业,协同采集采掘、运输、巡检、设备操作及异常处置数据,构建地形、装备、人员和作业流程协同建模能力,重点服务无人矿卡、巡检机器人和智能采掘装备,在真实作业前模拟塌方、故障、路径受阻等复杂情况,提高自主决策和安全作业水平。
二是建设先进制造“虚拟工厂—真实产线”闭环。支持电子信息、汽车、能源装备等领域龙头企业开放典型产线,积累装配、检测、搬运、异常恢复等操作数据,建设与真实产线相对应的虚拟工厂和训练环境,重点提升机器人跨产线、跨任务迁移和适配能力,加快具身智能在制造业规模化应用。
三是建设低空复杂环境世界模型。发挥四川盆地、山区、高原等多样化地形和气象条件优势,联合无人机、低空运营及人工智能企业,汇聚环境感知、飞控指令、航迹和任务结果等数据,构建地形、气象与飞行动作之间的动态模型,为物流运输、能源巡检、应急救援等场景提供复杂航线、突发天气和避障策略的提前推演能力。
© Copyright
雨前顾问原创作品 | 未经授权请勿转载 | 欢迎分享朋友圈
琴养气,剑藏锋。养气敛锋,锋化气。
竹无心,茶有道。无心问道,道随心。
雨前顾问·隐锋茶具
热门跟贴