智东西作者 杨京丽编辑 李水青
打开网易新闻 查看精彩图片
智东西作者 杨京丽编辑 李水青

智东西8月18日报道,昨天,多模态大模型公司智象未来(HiDream.ai)发布原生全模态交互式世界模型HiDream-O1-World

该模型支持文本、图像及交互等多模态输入,具备漫游、编辑和交互三大功能。用户可一键生成时空一致、符合物理规律、可长时推演的完整世界。

在第三方交互式世界模型评测基准WBench中,HiDream-O1-World以平均分80.9的成绩登顶Navi分榜。其中,该模型在物理(Physical)维度获得73.3分,位列第一,一致性(Consistency)维度得分为88.0。

HiDream-O1搭载智象自研的原生全模态(UiT)架构,在时空一致性与物理一致性上,取得了关键性突破:当镜头推拉摇移时,场景空间的几何结构仍可保持高度稳定,物体不会消失或变形;物体间的碰撞、遮挡、重力响应高度符合真实世界的因果逻辑,而非随机“猜”出来的画面拼接。

在实际体验中,用户可以从一段文字或一张图片出发,以第一人称或第三人称视角探索生成场景,并控制角色动作、天气及物体状态。智象未来计划将该模型用于AI互动影游、具身智能仿真和3D场景生产等方向。

打开网易新闻 查看精彩图片

针对交互式世界模型容易出现的场景漂移、物体消失和物理失真等问题,该模型将3D空间信息写入Memory上下文,并通过Test-Time Training(TTT,测试时训练)在推理过程中持续调整模型,以维持长时间交互下的空间和物理一致性。

值得注意的是,围绕空间一致性,智象未来与复旦大学联合开展的研究论文《DreamWorld:面向3D一致世界建模的几何驱动视频扩散》(DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling)已被国际顶会ECCV 2026接收。

打开网易新闻 查看精彩图片

项目主页:

https://yanghb22-fdu.github.io/DreamWorld

论文地址:

https://yanghb22-fdu.github.io/DreamWorld/asserts/DreamWorld.pdf

一、评测成绩突出,物理维度位列第一

截至目前,智象HiDream-O1-World在第三方评测榜单WBench的Navi分榜中,以平均分80.9的成绩登顶榜首,其中在物理(Physical)维度以73.3分位列第一,Consistency(一致性)维度达88.0分。

打开网易新闻 查看精彩图片

WBench由美团LongCat团队与复旦大学联合推出,是业内首个面向交互式世界模型的系统性评测基准。该基准涵盖289个多轮交互案例、1058个交互轮次,并从视频质量、设定遵循度、交互遵循度、一致性和物理真实性五个维度设置22项指标。

WBench分为Navi和Full两个榜单。其中,Navi分榜主要评估空间导航与视角控制能力,考察模型在连续运镜过程中能否准确执行指令,同时维持场景结构与物体状态。

HiDream-O1-World在Navi分榜登顶,并在物理维度取得第一,一定程度上反映出智象自研UiT架构在时空一致性与物理一致性上的关键突破。

二、一张图生成可探索空间,角色、天气和场景可编辑

HiDream-O1-World支持文字、图片和交互操控等多模态输入方式。用户可以输入文字描述,上传图片或简单交互,让模型以此为起点补全周边环境,生成可供后续探索的交互空间。

以室内场景为例,用户上传一张卧室照片后,模型可以根据画面中的空间关系继续生成房间其他区域,并在镜头移动过程中维持家具尺寸、摆放位置和遮挡关系。与单张图像扩展不同,这类生成不仅要补全画面,还需要让不同视角下的场景保持一致。

打开网易新闻 查看精彩图片

模型提供第一人称和第三人称两种漫游视角。用户既可以直接控制镜头前进、后退和转向,也可以驱动场景中的角色行走,并调整视角方向。

在潜水案例中,镜头在海底移动时,水面光影、珊瑚纹理和鱼群运动会同步变化;当镜头靠近珊瑚时,模型能够继续生成局部细节,并尽量维持整体场景的稳定性。

打开网易新闻 查看精彩图片

此外,HiDream-O1-World还支持实时编辑。用户可以让角色完成抓取、奔跑、下蹲和跳跃等动作,也可以调度环境变化,如触发降雨、物体坠落等环境事件。相应变化不局限于某个局部区域,模型还需要同步调整场景中的几何结构、光照、材质和物体关系。

打开网易新闻 查看精彩图片

在角色生成方面,该模型可处理人类、动物和虚构角色等不同主体。以登雪山场景为例,登山者行走后会在雪地上留下脚印,雪花运动会随风速变化,远处山体轮廓和近处岩石纹理也会随视角移动连续呈现。

打开网易新闻 查看精彩图片

场景风格同样具有较大的覆盖范围。除城市街景、自然环境和室内空间外,模型还可以生成幻想世界、二次元动画和3A游戏渲染等风格化内容。

打开网易新闻 查看精彩图片

三、空间信息写入记忆,动态维护3D一致性

长时间保持时空一致性,是交互式世界模型面临的核心难题之一。

传统视频生成模型主要根据有限的上下文,预测后续画面。当交互轮次增加、镜头运动范围扩大后,前面出现过的物体容易发生漂移、形变甚至消失;当镜头重新回到原来的位置时,场景也可能变成另一种布局。

HiDream-O1-World通过“3D先验注入Memory上下文”与“Test-Time Training(TTT,测试时训练)”两项机制,维持长时程空间一致性。

在生成过程中,模型会将场景几何结构、物体位置及空间关系等3D先验信息编码,并存储于Memory中。即使经过多轮镜头转动和位置移动,模型仍可以调用此前存储的空间信息,减少场景重置及物体位置变化。

Test-Time Training则用来动态维护3D一致性,在推理阶段,模型针对当前交互序列进行轻量级的在线自适应优化,使模型内部表征与当前场景的3D几何约束在推理过程中持续对齐。

在物理一致性方面,智象未来从训练数据和推理机制两端入手。训练阶段,团队利用生成式世界模拟器构建合成视频,覆盖刚体碰撞、流体运动、柔性形变、重力抛射及光影变化等容易出错的物理场景,并通过时序因果建模强化跨帧依赖。

推理阶段,TTT机制还可以针对当前场景中的材料和物体进行在线适应。例如,当画面出现水流、刚体或此前较少见的物体类型时,模型会动态调整内部表征,使后续生成结果尽量符合对应材料的运动特征。

智象未来称,在WBench的视觉合理性评测中,HiDream-O1-World相比参测模型平均水平提升13.6%;在考察流体、碰撞和形变等物理关系的因果保真度评测中,提升幅度为12.7%。

值得注意的是,该技术路线已得到国际顶会认可。智象未来与复旦大学围绕空间一致性开展的研究论文《DreamWorld:面向3D一致世界建模的几何驱动视频扩散》(DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling)已入选2026年欧洲计算机视觉国际会议(ECCV 2026)。

四、瞄准互动影游、具身智能仿真和3D场景生产

在应用层面,HiDream-O1-World主要瞄准AI互动影游、具身智能仿真和3D场景生产三类场景。

在AI互动影游中,模型可根据用户的移动、操作和选择实时生成后续场景,使剧情不再局限于预先制作的固定路线。用户可以直接参与叙事,并在同一世界中探索不同剧情分支。

在具身智能领域,模型可生成城市、工厂和室内等仿真环境,用于机器人、自动驾驶及智能制造系统的虚拟训练和测试。相比实景测试,仿真环境更容易批量构建低频、危险或高成本场景。

面向创作者和设计师,模型可用于生成手办、家居及艺术空间等3D场景,并支持结构调整、风格切换和内容补全。智象未来还计划进一步探索微观世界模拟,将其用于细胞行为、蛋白质相互作用等生命过程研究。

结语:世界模型竞争走向长时交互

HiDream-O1-World能够在连续交互中维持空间结构、物体状态和物理逻辑。其在WBench导航分榜和物理维度取得第一,也说明世界模型的竞争正在从画质和生成时长,进一步转向空间记忆、交互控制与物理一致性。

从互动影游到具身智能仿真,这些应用都要求模型生成的世界能够持续存在,并响应操作。HiDream-O1-World展示了原生全模态架构在这一方向上的进展,但距离大规模产业应用,交互速度、生成成本、长时间稳定性和仿真精度仍是需要继续验证的指标。

打开网易新闻 查看精彩图片