8月19日至23日,2026世界机器人大会(WRC 2026)在北京举行。期间,智象未来(HiDream.ai)创始人兼CEO梅涛发表提问《原生全模态世界模型:从“模拟世界”到“交互世界”》的主题演讲,围绕原生全模态世界模型以及Physical AI的发展路径进行了分享。
梅涛表示,过去几年,大语言模型、多模态模型与具身智能三条相对独立的技术路线正在加速融合。大语言模型擅长知识理解与推理,多模态模型进一步强化生成和预测能力,而具身智能则需要AI真正与物理世界发生交互。
“高IQ不代表全能。”梅涛认为,即便大模型在各类智力测试中的表现持续提高,也不意味着其能够在真实物理环境中长期、稳定地完成任务。真正的世界模型需要进一步具备对世界状态的表达、对物理规律和因果关系的推演,以及与真实世界持续交互的能力。
基于这一判断,智象未来正从传统多模态架构向原生全模态架构演进。近期,公司基于自研UiT(Unified Transformer)架构发布交互式世界模型HiDream-O1-World,支持文本、图像和交互式操控等多模态输入,并提供漫游、编辑、交互三类能力。
据介绍,HiDream-O1-World重点提升了长时程时空一致性和物理一致性,使模型能够在持续交互过程中保持场景结构,并对物体运动和物理关系进行推演。在交互式视频世界模型评测基准WBench中,该模型首次参评即登顶Navi分榜。
目前,智象未来正在围绕世界模型构建覆盖图像、视频以及交互式世界模型的产品矩阵。在应用层面,公司将AI互动影游、具身智能仿真以及3D场景生产视为世界模型的重要落地方向。
谈到具身智能的能力底座,梅涛将关键关系概括为:“世界模型和具身智能的发展,需要把数据、世界模型、智能体和具身本体连接起来。”其中,数据构建认知,世界模型负责理解世界状态、推演物理规律,智能体基于预测结果进行决策和规划,具身本体完成真实执行,而真实环境反馈又回流成为新的训练数据。由此形成“数据—认知—行动—反馈”的闭环飞轮。
梅涛认为,世界模型相当于这一闭环中的“认知中枢”。没有足够高质量的世界模型,仿真环境难以逼近真实物理世界,具身智能所需要的数据飞轮也难以真正运转。
数据层面,智象未来目前已积累近千万小时的视频数据。除了互联网数据之外,梅涛还特别强调仿真数据和真实交互数据对于Physical AI的重要性。
以智象未来与诺亦腾机器人的合作为例,双方尝试利用原生全模态模型对真实采集的人体动作数据进行增强,在保持动作和物理约束的同时生成不同背景、场景和人物特征的视频,以此扩大机器人训练数据规模,降低真实世界数据采集成本。
梅涛表示,大模型让AI理解世界,智能体与具身系统让AI行动于世界,而世界模型则进一步连接认知、行动与反馈。随着大语言模型、多模态模型与具身智能加速融合,世界模型正在成为Physical AI从数字空间迈向真实物理世界的重要技术底座。(袁宁)
热门跟贴