8 月 17 日,智象未来(HiDream.ai)发布交互式世界模型 HiDream-O1-World。在这款产品中,用户可以进入生成场景,自由移动和切换视角,也可以通过文字、语音或图片控制人物动作,改变场景接下来的发展。智象未来将其定位为“全球首款原生全模态交互式世界模型”。
过去两年,视频模型生成的画面越来越逼真,人物动作和镜头运动也越来越自然。但一段视频生成完成后,其中的人物、空间和故事通常随之固定。用户可以重新输入提示词,再生成一段视频,却很难直接进入已经生成的场景,继续改变里面发生的事情。
而交互式世界模型想解决的,正是视频生成之后的问题:用户开始介入时,模型能否记住此前的空间和人物,并根据新的操作继续运行这个世界。
视频生成之后,用户开始进入场景
HiDream-O1-World 提供漫游和编辑两种主要交互方式。
在漫游模式下,用户可以控制角色在生成场景中移动,并在第一、第三人称视角之间切换。进入第一人称视角后,用户可以转头、环顾、抬头或者向下观察。镜头每移动一次,模型都要根据新的相机位置继续生成场景,同时保持建筑结构、物体位置和人物关系基本稳定。
编辑模式将控制范围从镜头扩展到了场景中的人物和事件。用户可以通过文字、语音或图片发出指令,让角色完成抓取、奔跑、下蹲、跳跃和驾驶等动作,也可以改变人物接下来的行为和故事走向。
模型还支持写实、幻想、二次元和游戏渲染等视觉风格,生成主体可以是人类、动物或虚构角色。对于内容创作者来说,这些能力可以用来构建不同类型的数字场景,再通过连续操作调整镜头、人物和情节。
从操作方式看,HiDream-O1-World 与游戏有些相似,但两者生成场景的方式并不相同。
一款传统游戏需要提前制作地图、角色、材质、灯光和动作规则。玩家进入游戏时,所看到的世界已经由开发团队搭建完成。生成式世界模型则从一张图片或一段指令出发,在用户移动和操作的过程中继续生成环境。用户尚未看到的空间、人物接下来的动作,都由模型实时补充。
因此,衡量交互式世界模型的标准也与普通视频模型不同。除了画面质量,模型还要执行用户的操作,维持空间结构,并让动作产生合理的后果。一段视频只需要在播放期间保持连贯,一个可交互的世界还要经受多轮操作。
7 月 29 日,HiDream-O1-World 被加入美团 LongCat 团队与复旦大学共同发布的 WBench 榜单。WBench 用 289 个测试场景、1,058 轮交互和 22 项指标,考察模型的视频质量、指令执行、空间一致性和物理合理性。
在 WBench 的 Navigation Split 中,HiDream-O1-World 综合得分为 80.9,在 30 个参评模型中位列第一,超越阿里快乐生蚝和腾讯混元 HY-World1.5;一致性得分为 88.0,物理维度得分为 73.3,其中物理维度同样排名第一。
这组成绩说明,HiDream-O1-World 在相机移动、空间保持和物理合理性等任务中取得了较好的综合表现。不过,基准测试仍是限定条件下的评估。面对开放场景时,模型能够稳定运行多长时间、操作响应是否足够快、复杂动作能否准确执行,还需要更多实际体验来验证。
让场景持续下去,比生成第一帧更难
普通视频模型主要追求画面在一段时间内连续。交互式世界模型还需要记住此前发生过什么。
传统视频生成通常以像素为基础,场景的几何结构、物体纹理、材质和光影紧密地结合在画面里。前后两帧之间出现一点误差,短视频中可能并不明显;生成时间延长后,误差会逐渐累积,最终表现为人物变形、物体漂移或者场景结构改变。
用户操作会进一步增加生成难度。移动镜头、改变人物动作或者挪动物体,都会打破原有画面的平衡。模型既要响应新的指令,又要保留此前生成的空间关系,任何一个环节发生偏差,都可能让场景失去连续性。
借影视制作的过程来类比一下,传统视频模型就像一位逐帧作画的画师。人物、背景和光影都要在每一帧里重新呈现,前面的细小误差很容易带到后面。
HiDream-O1-World 希望采用另一种生成方式:先在模型内部建立相对稳定的空间结构,再根据新的视角生成纹理、材质和光照。这个过程更接近在虚拟片场中工作。模型先搭好舞台,确定人物和物体的位置;镜头移动后,再根据新的观察角度重新打光和上色。
按照智象未来团队的介绍,HiDream-O1-World 会将场景的几何结构与外观信息分开处理。空间结构决定一面墙在哪里、人物与桌子之间相隔多远;纹理和光照则决定墙面的材质以及场景看起来是什么风格。两部分相对独立后,镜头和人物发生变化时,模型不必把整个画面推倒重来。
为了维持较长时间的空间一致性,HiDream-O1-World 还使用了 3D 先验注入 Memory 上下文与 Test-Time Training 两套机制。
3D 先验注入 Memory 上下文模型在生成过程中维护一个持续更新的空间记忆上下文,将场景的几何结构、物体空间关系等 3D 先验信息编码并存储于 Memory 中。一个物体暂时离开当前画面后,模型仍然需要记住它曾经出现的位置;用户再次进入相关区域时,后续画面才能与此前的场景衔接。
Test-Time Training 即测试时训练。普通模型完成训练后,推理阶段的参数基本固定;HiDream-O1-World 会根据当前场景和相机运动进行在线适应,让后续生成继续遵循已经建立的空间关系。
除了记住空间,模型还要处理动作带来的结果。
以抓取为例,画面中出现一只手和一个杯子并不困难。真正的物理一致性要求手指准确接近杯子,杯子随手移动,松开后再受到重力影响。碰撞、流体、柔性形变和重力抛射等场景,也都需要模型理解物体之间的因果关系。
智象未来在训练过程中加入了这类物理场景,希望模型从大量视频中学习运动规律。WBench 的物理维度主要考察视觉合理性和因果一致性,HiDream-O1-World 在这一维度的成绩,也来自模型对碰撞、运动轨迹和场景变化的处理。
而这些能力的底座则是智象未来自研的 Unified Transformer(UiT,统一 Transformer)世界模型架构。按照公司的技术说明,UiT 将图像像素、文字、视频、音频、动作和空间关系转换到同一个共享 Token 空间,再由同一套模型进行理解、生成和推理。文字、图像和动作不再分别交给不同模块处理,而是在训练初期就进入统一的表征系统。
这也是“原生全模态”的主要含义。用户的一句语音指令、一个人物动作和场景中的空间变化,在模型内部都成为可以相互关联的信息。HiDream-O1-World 能否把这种统一架构转化为稳定的产品体验,则要看模型在复杂场景中的长期表现。
从生成内容,到模拟世界
加拿大工程院外籍院士、智象未来创始人兼 CEO 梅涛将他们的全模态技术路线概括为一句话:“图片是入口,视频是过程。”
一张图片记录了人物、物体和环境在某个时刻的状态。沿着时间轴延展,静态画面变成了视频;继续加入用户操作、空间记忆和物理反馈,模型才开始处理一个世界如何持续变化。
团队从 2017 年开始探索文本生成视频,2026 年,HiDream-O1-Image 开源模型和商用模型 HiDream-O1-Image-1.5 又先后进入 Artificial Analysis 榜单前列。
这些图像模型为 HiDream-O1-World 提供了人物、材质、文字和空间布局等基础能力。进入世界模型阶段后,新的难题又变成了如何记住空间、接受操作,并让每次操作产生可以延续的结果。
从整个行业看,世界模型的探索大致存在几个不同入口。有的团队侧重预测环境的下一状态,主要服务机器人的判断与行动;有的团队从 3D 空间出发,强调场景结构和可编辑性;还有一批团队从视频生成切入,希望模型直接从大规模视频中学习运动、空间和物理规律。
几条路线各有长处。状态预测更接近智能体规划,3D 路线拥有更稳定的几何结构,视频路线则拥有更丰富的数据和更直接的视觉表现。它们也面临各自的限制:抽象状态不容易转化为高质量内容,显式 3D 场景的生成和维护成本较高,视频模型则要解决长时间生成中的空间漂移和物理失真。
目前还看不出哪条路线会形成统一方案。更可能出现的结果是相互吸收:3D 模型使用生成技术改善视觉质量,视频模型加入空间记忆和结构约束,面向机器人和自动驾驶的模型也开始同时处理语言、视频、动作与传感器信息。
HiDream 选择视频路线,与团队长期从事视觉生成有关,也决定了 HiDream-O1-World 近期最容易进入的应用场景。
AI 互动影视和游戏是最直接的方向。传统互动影视需要提前拍摄不同的剧情分支,用户只能在已有片段之间选择。交互式世界模型可以根据用户的操作继续生成场景,使人物和情节拥有更多变化。
广告、短片和虚拟制作也可以使用类似能力。创作者先生成一个场景,再调整机位、人物动作和空间布局,用于分镜预演和部分素材生产。面向设计师,模型还可以生成家居、展览或艺术空间,再继续修改结构、材质和风格。
另一个方向是具身智能。现实世界的数据采集成本较高,危险和极端场景也难以反复制造。世界模型可以改变人物、环境、视角和光照,扩充机器人训练所需的视频数据。
智象未来已经与动作捕捉公司诺亦腾机器人合作,将真实人体动作扩展到不同人物和场景中。按照双方计划,年内将生成数万小时具身智能视频数据。真实动作提供基础的物理约束,生成模型负责增加人物、背景和视角的多样性。
不过,视觉上合理的视频还不能直接等同于可用的机器人训练数据。影视画面可以容忍的细微误差,放到机器人抓取或自动驾驶中,可能会改变训练结果。生成数据能否提高模型能力,还需要在训练和实机测试中形成闭环。
梅涛将世界模型的目标区分为 “model the world” 和 “mold the world”。前者强调理解和表达世界,后者还要求模型允许人进入其中,改变世界接下来的运行方式。
HiDream-O1-World 已经开始接收连续的用户指令。下一步要验证的,是一次操作结束后,它能否把这个操作带来的变化继续保留下去。
热门跟贴