导语
世界模型(World Model)是一种内部模拟器,能够学习环境如何演化,并推演不同行动可能导致的后果。近日,arXiv发布的一篇百页综述从架构、训练方法、推理范式和应用场景四个维度,对世界模型进行了系统分类,并梳理了其关键瓶颈与未来方向。综述提出,与依赖自然语言展开推理的思维链不同,世界模型可以直接在潜空间中模拟状态变化,形成扎根于时空与行动的“想象链”。由此,世界模型可能从预测未来的模拟器,进一步演变为支持规划和决策的推理引擎。
关键词:世界模型、思维链、认知科学、扩散生成模型、反事实推理
来源:集智俱乐部
作者:郭瑞东
审校:赵思怡
论文题目:World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications 论文链接:https://arxiv.org/abs/2606.00133 发表时间:2026年5月28日 论文来源:arXiv
世界模型的历史与架构
世界模型植根于一种更广泛的预测性智能观。智能系统不仅对当前输入做出反应,还能通过预测未来状态、估计行动的后果,并利用内部模拟来指导行为。这一思想与认知科学、神经科学和强化学习中的早期传统有着密切联系,包括预测加工、预测编码和预测性表示。世界模型与基于模型的强化学习和生成式潜在动力学建模同样密切相关,其中智能体不仅学习如何行动,还学习世界如何响应行动而发生变化。
图1概述世界模型的发展史,在认知科学中,人们早就认识到,人类通过将外部世界抽象为简化的元素和关系结构来解释它。这一观点体现在Johnson-Laird的心理模型理论,并与20世纪70年代Minsky提出的框架表示(frame representations)等人工智能早期发展产生了共鸣 。深度学习的出现为将世界模型概念付诸实践开启了一个新时代。在强化学习(RL)中,Ha 和 Schmidhuber证明了生成式神经网络可以以无监督的方式学习环境的紧凑空间和时间表征。值得注意的是,他们的工作表明,智能体甚至可以在完全由这些学习到的表征衍生出的内部生成模拟中进行训练。
图1:世界模型的发展历史
LeCun将世界模型确定为自主智能的核心架构组件,提出它应该推断关于世界当前状态的缺失信息,并预测由想象的动作序列所产生的合理未来状态。在基于模型的强化学习(MBRL)中,Dreamer 系列 证明了智能体可以完全通过潜空间想象来学习复杂行为,使用统一的算法框架从简单的控制任务扩展到不同的领域。与此同时,DeepMind的MuZero通过学习一个仅预测与规划相关数量的隐式模型,在无法访问明确环境规则的情况下,在几个具有挑战性的领域中实现了超越人类的表现。OpenAI 的 Sora引入了大规模视频生成作为一种世界模拟的形式,引发了关于此类模型是否构成真正世界模型的争论 。来自 Meta(V-JEPA 2)、DeepMind(Genie )和 NVIDIA(Cosmos)的基础模型方法进一步证明,大规模自监督预训练可以分别产生用于机器人规划、交互式环境生成和物理 AI 的可操作世界模拟器。这些努力与 LeCun 的更广泛愿景相一致,即围绕一个可通过其提出的联合嵌入预测架构训练以预测世界模型为中心的模块化认知架构。
以下三个特性将世界模型与一般的预测模型区分开来:
以行动为条件(Action-conditioning):世界模型预测环境如何响应特定行动而演化,从而支持反事实推理(“如果我向左转而不是向右转,会发生什么?”)。
多步推演(Multi-step rollout):世界模型可以自回归地应用,以生成任意长度的轨迹,从而支持规划和模拟。
对决策的实用性(Utility for decision-making):世界模型的预测被下游任务所使用——用于策略优化、规划、数据增强或安全验证——而非仅作为目的本身。
世界模型包含将原始高维观测(图像、点云等)映射为紧凑的潜在表征的编码器 (Encoder),预测给定当前状态和动作后的下一个潜在状态的动力学模型 (Dynamics Model),以及从当前潜在状态估计标量奖励的奖励预测器 (Reward Predictor)。从潜在状态重建观测,提供重建损失以辅助训练,并支持可视化“想象”的轨迹的解码器(Decoder)是可选组件。
该综述将世界模型视为三个紧密耦合的子系统,分别是:
视觉模型 (Visual Model):过滤无关的感知细节,保留对下游预测和控制最关键的特征,解决原始观测空间维度灾难的问题。
记忆模型 (Memorial Model):整合当前观测与历史上下文,推断隐藏结构,跟踪时间依赖关系,并表示对未来状态的不确定性。它使模型超越静态感知,成为动态的预测模拟器。
控制模型 (Control Model):基于视觉模型编码、记忆模型更新的潜在状态,决定应采取何种动作以最大化预期奖励或满足约束。它将预测知识转化为有目的的行为。
基于架构的世界模型分类
世界模型的架构反映了模型如何编码观测、表示动态、处理不确定性以及支持下游决策的一个关键设计层面。根据世界模型如何将原始观测数据(如图像、视频、传感器读数)转化为内部可操作的状态表征,可将其分为连续,离散与混合三类。根据当前状态和动作如何导致“下一个状态,可将世界模型分为三类:
1. 确定模型给定当前状态和动作,输出唯一确定的下一个状态;随机动力学模型将潜在状态分解为确定性记忆和随机性潜在变量。
2. 隐式生成模型完全不重建观测,也不预测可解释的物理状态,而是学习一个隐式的潜在空间,该空间仅被优化用于预测策略、价值和奖励。
3. 表征空间预测模型结合扩散模型,在隐空间中进行迭代去噪以生成未来状态;记忆增强模型利用Transformer的全局注意力机制或状态空间模型替代传统的RNN,以应对长程关联。
根据数据来源,仅依赖 RGB 图像或视频流的为纯视觉世界模型;将文本环境知识图谱作为世界状态,利用 LLM 进行反事实推理和规划为纯语言世界模型 ;处理 LiDAR 点云、深度图多用于自动驾驶场景的4D时空预测的为几何世界模型;处理机器人关节角度、力矩反馈和触觉传感器数据的本体感受与触觉 (Proprioceptive and Tactile)类模型对精密操作(如灵巧手抓取)不可或缺;使用多种输入的是多模态融合 (Multimodal Fusion)则是当前最前沿的方向。
按“学习范式”分类,世界模型的知识获取方式涵盖了从利用海量无标签数据学习通用物理常识的自监督/无监督学习、强调交互样本效率的在线基于模型强化学习 (MBRL),到规避现实试错风险的离线/批处理学习,以及直接拟合专家轨迹的模仿学习;而当前的发展趋势是走向混合多阶段学习与基础模型,即先在海量多模态数据上进行大规模自监督预训练以构建通用的物理与因果先验,随后通过模仿学习或在线微调将其高效适配到特定的具身交互与下游决策任务。
根据下游任务,反推模型架构。强化学习与规划任务要求模型具有极低的推理延迟和精确的价值评估能力,倾向于隐式或连续潜在空间。自动驾驶要求模型具备 3D 空间理解和长视距的多智能体博弈预测能力;机器人与具身智能要求模型融合视觉与触觉,并支持仿真到现实的无缝迁移。医疗与科学建模将疾病进展或分子动力学视为“环境”,用于反事实干预和治疗方案规划。视频生成与创意仿真侧重于视觉保真度和物理规律的涌现(如 Sora),语言推理与决策 (Language Reasoning):将 LLM 作为世界模型,通过思维链(CoT)或想象链(CoI)进行逻辑推演。
基于训练目标与归纳偏置的分类
同样的架构可以有不同小训练目标,由此引出了对世界模型的另一种分类方法。基于世界模型如何处理环境动态,可对世界模型进行侧重数学原理与训练目标的分类方式。基于变分推断的方法,将世界建模视为一个概率推断问题,利用变分自编码器 (VAE) 框架,通过最大化证据下界 (ELBO) 来同时优化重建误差和正则化项(KL 散度),旨在学习潜在状态的后验分布 。
面向隐式价值摒弃了“重建观测”的目标,认为世界模型只需学习对决策有用的抽象表示,例如使用蒙特卡洛树搜索 (MCTS) 与自我对弈。自回归序列受大语言模型 (LLM) 成功的启发,将世界建模转化为下一个Token 预测问题。具备极强的泛化能力和多任务处理能力;Genie 等模型展示了从互联网视频中学习可交互环境的潜力。
扩散与生成类模型将未来状态的预测建模为一个从噪声中逐步去噪的过程。可以是像素级扩散,也可以是潜在空间扩散,通过反向扩散过程生成未来轨迹,允许模型在生成过程中反复修正预测。相比自回归,扩散模型在某些设置下支持并行采样或多步联合优化。其生成的轨迹具有极高的保真度和物理一致性;能够有效建模复杂的多模态分布,但其推理成本高,需要多次迭代去噪步骤,训练稳定性挑战较大。
Yann LeCun大力倡导的联合嵌入预测架构家族 (Joint-Embedding Predictive Architecture)在抽象的特征表示空间中进行预测。编码器将输入映射为嵌入向量,预测器预测未来时刻的嵌入向量,并通过对比损失或余弦相似度进行优化。代表模型包括V-JEPA, I-JEPA, MC-JEPA。这类模型计算效率极高,专注于学习对下游任务有用的不变特征;避免了生成式模型常见的“幻觉”和模糊问题。目前主要应用于感知和理解层面,如何将其无缝整合到闭环控制和规划中仍是研究热点。
纯数据驱动的模型在长程展开时容易违反物理定律。为此,研究者提出了四类将物理先验或关系结构直接嵌入世界模型的方法。
物理守恒的神经动力学模型利用经典力学公式强制网络遵守能量守恒等物理定律;
基于图神经网络 (GNN) 的动态模拟器将物理系统(粒子、刚体、可变形网格)自然表示为图,节点代表实体,边代表相互作用;以对象为中心的世界模型将视觉场景分解为离散的对象表示,从而支持对动力学的组合推理;
等变与对称性保持模型利用了物理定律具有对称性(如平移、旋转、反射不变性),标准神经网络需要通过数据来学习这些不变性,而等变与对称性保持模型将其直接内置于网络结构中;
神经符号与组合方法将神经学习与显式的符号推理相结合,试图从数据中恢复可解释的物理定律。具体通过符号回归从训练好的 GNN 模拟器中提取符号表达式(如成功恢复了牛顿万有引力定律);或将视觉观测锚定到符号对象描述和组合动力学规则中,实现对未见过的对象/交互组合的强泛化能力。
纯视觉的世界模型缺乏自然语言所提供的丰富语义和组合结构。人类认知中会习惯性地将语言与感知经验结合来预测世界,当前学界也试图在世界模型中加入语言模型,例如在现有的潜在动力学(Latent Dynamics Models)架构中,语言作为额外的条件信号输入,语言理解与未来预测统一为单一的自监督目标,联合预测未来的文本和图像表示,另一种方法是通过语言将视频生成架构转化为世界模拟器,用语言作为控制大规模生成式世界模型的接口,从而通过文本提示生成可交互的、符合物理直觉的 3D/视频环境的能力,例如NVIDIA Cosmos和DeepMind Genie。
更激进的方法是绕过像素级预测,直接在语言和语义空间中进行推理,将世界建模重新定义为关于未来的视觉问答 (VQA):给定当前观测和候选动作,模型直接回答这些动作效果的自然语言问题。此外,还可以使用统一的多模态架构,在单一的世界模型框架内构建端到端架构,原生地整合视觉、语言和动作,支持在世界模型、VLA(Vision-Language Action)模型和视频生成模式间灵活切换。
基于推理方法的分类
前几节关注的是模型“如何构建”(架构与方法),第 5 节则聚焦于模型“如何使用”,即推理与决策机制。该节将世界模型的推理策略系统地划分为四大类。
基于想象进行规划的世界模型最标志性,会在内部沙盒中在智能体与外界交互的间隙预演未来,利用世界模型在后台生成大量的虚构轨迹(rollouts),并用这些数据来更新策略或价值函数,或在需要执行具体动作的当下,模型在线展开搜索,评估其预期回报,并选择最优的即时动作(图2),实际应用中,规划是针对动作序列进行的,且每一步的轨迹展开都以该步的动作为条件。推理过程也可在隐空间跨域进行,这使得同一个规划算法可以无缝应用于从 Atari 游戏到机器人控制的多种任务。
图2:隐空间进行的基于想象的推理
并非所有基于世界模型的方法都需要在线搜索。许多现代方法(如 TD-MPC, DreamerV3)选择直接在可微的世界模型上端到端地训练参数化策略。世界模型在这里充当了一个可微的模拟器。梯度可以从预测的未来回报,穿过动力学模型,直接反向传播到策略网络的参数中。此外,在离线强化学习中,世界模型被用作强大的数据增强引擎,通过生成合成轨迹(Synthetic rollouts)来扩充有限的静态数据集,从而缓解分布外动作评估的难题。
在复杂环境中,结果的好坏往往受环境随机性影响。反事实推理允许智能体回答:“在完全相同的初始状态下,如果我当时采取了不同的行动,结果会怎样?” 这能精准隔离出特定决策的真实因果效应。前沿研究正致力于将因果图(Causal Graphs) 或结构因果模型(SCMs) 嵌入世界模型的架构中,确保模型在受到未见过的干预时,仍能遵循正确的因果机制进行推理。世界模型执行反事实推理时,遵循溯因-行动-预测流水线 (The abduction-action-prediction pipeline),具体分为三步:
溯因 (Abduction):根据当前的实际观测,推断出环境中未观测到的隐藏变量或噪声,更新对当前世界状态的信念。
行动/干预 (Action/Intervention):在模型中强制执行一个假设的动作,切断该动作与其常规自然原因的联系。
预测 (Prediction):使用修改后的模型,向前推演该干预动作会导致的未来结果。
在真实世界中,环境是部分可观测的,且具有内在随机性,因此需要在不确定性下进行规划。世界模型必须预测未来状态的概率分布,而非单一确定值。这通常通过随机隐变量、集成模型或扩散模型捕捉环境中的“多种可能的”未来来实现。在不确定性下,最大化“期望回报”可能导致灾难性后果(例如自动驾驶中 99% 安全但 1% 致命)。推理策略需要引入风险度量,如在模型不确定性高的状态-动作对上给予惩罚,促使智能体保守行事。还可通过预测整个回报分布,从而允许规划器根据风险偏好进行优化。此外,主动信息收集策略要求受世界模型引导的智能体采取那些能最大程度减少状态不确定性的“探索性”动作,而不仅仅是追求即时奖励。
基于应用场景的分类
在不同应用场景,世界模型呈现出高度定制化的形态。机器人学与具身智能 (Robotics and Embodied AI)是世界模型最传统也是最核心的应用场景,旨在解决真实世界中试错成本高、数据稀缺的问题。通过在世界模型提供的潜在空间(Latent Space)中进行数百万步的“想象”训练(如 DreamerV3),智能体可以在极短的真实交互时间内掌握复杂技能(如灵巧手抓取、双足行走)。世界模型充当了高保真的内部模拟器,缓解了现实物理实验的高昂成本。对于需要多步逻辑推理的任务(如“打开冰箱-拿出鸡蛋-打碎-煎蛋”),世界模型能够通过多步展开(Rollout)评估长期后果,避免局部最优解。现代机器人世界模型不再局限于视觉,而是融合了力矩、触觉反馈(如 GelSight 传感器数据),构建包含物理接触动力学的多模态表示,从而实现对柔性物体或易碎品的精细操作。
自动驾驶是世界模型在安全关键型(Safety-critical)系统中的典型应用,重点在于处理复杂动态环境和极端情况(Corner Cases)。以 OccWorld 和 UniAD 为代表的4D时空预测模型,不仅预测周围车辆的未来轨迹,还预测整个场景的 3D 占据状态变化。这种“视频级”的场景演化预测比传统的轨迹预测更能捕捉复杂的交通博弈。世界模型提供的反事实安全验证利用世界模型进行“What-if”分析。例如:“如果前车突然急刹,或者旁边有车强行变道,我的当前策略是否安全?”通过内部模拟成千上万种可能的突发状况,系统可以提前规避高风险动作。而最终想要实验的端到端自驾策略学习将世界模型作为中间层,连接感知模块(输入摄像头/LiDAR)和控制模块(输出转向/油门),允许梯度从最终的驾驶表现反向传播到感知特征提取器,实现基于数据的实时自动驾驶的优化。
Sora、Genie这类在物理学上足够真实的视频生成,也可被视为世界模型,当视频生成模型在海量数据上训练时,会自发学习到重力、碰撞、流体动力学等基本物理规律。这使得它们能够生成符合直觉的物理交互视频。DeepMind的Genie,不仅能生成视频,还能将生成的帧作为游戏环境,允许用户通过按键与之交互。这标志着从“被动观看”到“主动探索”的转变。在制造业中,这些模型被用于构建工厂或产品的数字孪生体,通过模拟生产流程中的微小扰动来优化效率,而无需停机测试。
在数据密集型科学,世界模型被用于模拟那些难以用解析方程描述的复杂系统。NVIDIA的FourCastNet或华为的Pangu-Weather,利用世界模型学习大气动力学的非线性演化,其预测速度和精度在某些指标上已超过传统的数值天气预报模型。药物发现任务上,将分子结构视为图,利用GNN驱动的世界模型模拟蛋白质折叠或药物分子与靶点的结合过程。这种模拟比量子化学计算快数个数量级,加速了新药的筛选。天体物理学家利用世界模拟星系演化、黑洞吸积盘等宏大尺度的物理现象,以理解宇宙中的结构形成。
在医疗领域,世界模型被用于构建患者的“数字生理双胞胎”,支持个性化治疗和预后评估。使用电子健康记录(EHR)和医学影像序列,世界模型可以预测如阿尔茨海默病、糖尿病等慢性病的未来发展轨迹。当将世界模型应用于疗效评估,可回答“如果给这位患者使用药物 A 而不是药物 B,他的各项指标会如何变化?”这种反事实问题,据此避免了在真实患者身上进行无效试错的风险,且能制定个性化治疗方案。或在虚拟环境中模拟手术步骤,预测组织切割、缝合后的生理反应,辅助医生进行术前演练。基于医学影像的世界模型,主要涉及基于MRI/CT影像序列预测肿瘤体积变化,评估化疗或免疫疗法的效果。由于医疗决策事关生死,对准确性要求极高,因此目前没有任何应用于医疗对世界模型真正达到自主规划与控制的L4级别。
图3:医疗领域的世界模型应用
图4:世界模型在教育界的应用
此外,在教育中,可通过世界模型构建个性化的学生学习路径模型(图4),模拟“如果给学生 A 推送这道几何题,他的知识状态会如何变化?”从而优化长期的学习曲线,而非仅仅追求即时正确率。结合生成式世界模型,系统可以根据学生的当前状态,动态生成最适合其认知水平的练习题或解释文本,实现真正的“因材施教”。
在金融和商业中,世界模型可以模拟高频交易中订单簿的动态变化,预测大额交易对价格的冲击(Market Impact)。通过模拟环境中的强化学习训练交易策略,避免在真实市场中试错带来的巨大财务风险。或利用世界模型生成极端的“黑天鹅”市场情景(如金融危机、地缘政治冲突引发的震荡),评估投资组合在这些反事实情景下的表现。此外,在供应链管理中,可构建包含供应商、制造商、物流商和消费者的全链路世界模型,模拟突发事件(如战争、自然灾害)对全球供应链的级联影响,优化库存水平和物流路由。
世界模型的评价标准与阻碍
在讨论完世界模型的各种分类后,该综述指出缺乏统一、标准化的评估体系是阻碍其比较和进步的主要瓶颈。文中系统梳理了现有的三类评估方法,传统的经典强化学习与环境模拟基准或测试样本效率和泛化能力,或测试连续控制任务中的动力学建模精度。基于 Minecraft 的基准测试旨在评估模型的长视界规划、开放世界探索和资源管理能力。自动驾驶基准涉及感知-预测-规划全链路评估。
针对视频生成任务,Physics-101 / CLEVRER等任务评估模型生成视频的物理一致性,专门评估模型对物体碰撞、重力、遮挡等物理规律的理解程度,而非仅仅视觉保真度;VBench/GenBench评估生成视频的时间一致性、动作连贯性和文本对齐度。新兴的基准考察认知与因果推理,例如ARC-AGI测试模型在极少样本下的抽象规则归纳能力;Counterfactual Reasoning Datasets专门用于评估 L3 级反事实推理能力的定制数据集(如医疗或交通场景下的“What-if”问答)。
尽管进展迅速,世界模型在架构、方法论家族和应用领域方面仍面临若干根本性挑战。自回归世界模型通过将自身的预测递归地作为输入来生成未来状态,这一过程导致每一步的微小不准确性在展开(rollout)过程中呈乘法级累积。学习模型与真实环境之间的回报差异随展开长度 k 和单步模型误差εm 性增长。在实践中,这意味着一个单步预测误差仅为1%的世界模型,在仅仅几十步的想象后就会与现实严重偏离,产生物理上不可信或语义上不连贯的轨迹。
更长的想象视界增加了智能体的规划能力,但同时也放大了利用模型不准确性的风险。目前没有任何方法能完全解决这种权衡:受控展开视界牺牲了长期规划,多步预测方法难以处理复杂的视觉观测,而分层模型在每一层都引入了额外的学习挑战。开发能够在数百或数千步内保持校准预测的世界模型,以匹配自动驾驶和医疗治疗等领域现实世界规划所需的时间视界仍是一个关键的开放问题。
此外,世界模型在训练需要海量数据,NVIDIA 的Cosmos开源世界基础模型提供了 40亿、70亿、120亿和 140亿 等多种参数量级的开源权重世界基础模型,这些模型在超过 2,000 万小时的视频上进行训练。推理过程时的算力瓶颈也是一大阻碍,基于扩散的世界模型受影响尤为严重,因为每一帧预测都需要多次去噪迭代。未来需探索更高效的推理加速技术,如并行采样、蒸馏技术或分布式训练架构,以支撑大规模时空数据的实时模拟。”
在仿真中训练的世界模型受益于无限的数据、完美的状态访问和安全的探索,但由于仿真环境与物理环境之间的系统性差异, 这样训练出来的模型在部署到现实世界时往往会失败。这种模拟和真实之间的鸿沟表现在两个大致正交的轴上:视觉领域鸿沟(源于渲染质量、光照、纹理和传感器特性的差异)和动力学领域鸿沟(源于不准确的接触模型、简化的摩擦和变形物理,以及真实执行器和传感器中未建模的延迟和噪声)。
现实环境本质上是多模态的:视觉、听觉、触觉、本体感觉和语言信息都与构建准确的世界模型相关。当前方法主要集中在视觉输入上,对其他模态的整合有限。将世界模型接地于物理现实,以确保预测尊重物理定律、物体持久性和因果关系仍然是一个开放的挑战。
此外,制约世界模型应用的,还包括在安全关键型应用(自动驾驶、医疗决策、机器人)中部署世界模型要求模型的预测可靠、校准良好且可解释。过度自信的预测可能导致危险行动;信心不足的预测可能导致过于保守的行为。对学习到的世界模型进行形式验证,以及量化并向下游决策者传达预测不确定性的方法,对于现实世界部署至关重要。
结论与未来展望
对于“什么构成了一个世界模型”,目前仍然没有普遍接受的定义。在基于模型的强化学习中,世界模型通常指学习到的状态转移模型与奖励预测器的结合,从而实现通过“想象”进行规划。世界模型也被用于生成逼真视频但没有任何明确动作或奖励概念的视频生成系统;其内部表示可能编码、也可能不编码因果结构的语言模型。医学和气候科学等领域的特定领域模拟器也被称为世界模型。因此需要明确区分在动作条件下预测未来状态并支持下游决策的 “预测性世界模型”和生成逼真的感官数据,但不一定支持交互控制的 “生成式世界模拟器”。
学界的另一趋势,是世界模型与基础模型的持续融合,这类模型作为通用模拟器,可以通过微调或提示(prompting)适应下游任务。这一轨迹与语言模型从特定任务系统向通用推理引擎的演变非常相似。原则上,一个单一的预训练世界模型可以为机器人、自动驾驶、科学建模和医疗模拟提供共享的表示基础,从而减少对特定领域数据收集和大量特定任务工程的需求,但实际中能否有效迁移到受根本不同物理原理支配的领域仍是开放问题。
当代基于视频的世界模型可以生成令人惊叹的逼真图像,但它们经常违反基本物理原理:物体可能相互穿透,重力表现可能不一致,守恒定律可能被忽略。一个偶尔会生成幻影障碍物或无法保持车辆动量的驾驶世界模型,对于安全关键型规划来说几乎没有价值。弥合这一差距可能需要超越纯粹的数据驱动方法,转向融入更强物理归纳偏置(inductive biases)的架构,无论是通过等变网络设计、物理信息损失函数,还是将学习组件与已知控制方程相结合的混合神经符号系统。
对于未来世界模型的发展,该文指出世界模型可能会从被动的模拟器演变为主动的推理引擎,能够支持在潜在空间中进行多步深思熟虑。如果这一轨迹继续下去,“思考”和“模拟”之间的界限可能会变得越来越模糊,世界模型将成为感知和认知的共享基础。将复杂环境分解为可重用组件,并在多个时间和空间抽象层次上进行推理的系统的分层和组合式世界模型的仍然是一个重要但尚未实现的目标。现有的分层方法在结构化环境中展示了有希望的结果,但将这些思想扩展到以异构对象、不确定的交互和长视界任务结构为特征的开放式现实世界设置中,仍然是一个重大挑战。
阅读最新前沿科技趋势报告,请访问21世纪关键技术研究院的“未来知识库”
未来知识库是 “21世纪关键技术研究院”建 立的在线知识库平台,收藏的资料范围包括人工智能、脑科学、互联网、超级智能,数智大脑、能源、军事、经济、人类风险等等领域的前沿进展与未来趋势。目前拥有超过8000篇重要资料。每周更新不少于100篇世界范围最新研究资料。 欢迎扫描二维码或访问https://wx.zsxq.com/group/454854145828进入。
截止到2月28日 ”未来知识库”精选的百部前沿科技趋势报告
(加入未来知识库,全部资料免费阅读和下载)
热门跟贴