编辑|杜伟
进入到 2026 年,可交互世界生成面对一道更难的考题:AI 生成的世界能否经得起用户反复探索?一扇门画得逼真,只是起点。往前走,它要自然靠近;穿过走廊再回头,它还应该留在原来的位置。用户每一次移动、转身和折返,都在检验模型是否有能力记住已经生成的世界。
世界模型的竞争开始从画面质量延伸到持续交互中的可靠性。镜头要听从指令,场景要保持连贯,生成速度还要跟得上操作。这些能力需要同时成立,任何一处掉链子,都可能打断探索。
近一年来的技术进展,让这条主线更加清晰。谷歌 DeepMind 的 Genie 3 展示了实时探索与分钟级一致性,英伟达 SANA-WM 将分钟级生成、精确相机控制与更高效率结合了起来,World Labs 的 Atlas 通过空间上下文支持沿指定相机轨迹生成新视角,维持场景的几何关系。
当探索进一步触及到视听体验,新的问题随之出现:用户改变路线或者切换视角时,脚步声、环境声和人物说话声,是否能够与画面一起连贯地延续?因此,对于面向沉浸式内容的世界模型,视听生成与交互控制的结合更加值得关注。
9 月 9 日,在京东全球科技探索者大会(JDD)上,京东探索研究院发布 JoyAI-Echo 系列最新进展:超长音视频生成模型升级至 JoyAI-Echo 1.5;同时发布并开源面向可交互视听世界生成的 JoyAI-EchoWM。
该模型延续了此前 JoyAI-Echo 的原生音视频生成能力,在同一套框架中可以生成视频以及环境音、音乐和语音,同时能够实时响应用户操作。
现在,第一人称视角下,用户可以直接在场景中移动和探索;切换到第三人称视角,摄像机运动与主体运动也能保持协同。经过多轮、长时操作之后,整体画面、空间关系、主体状态依然能够很好地延续。JoyAI-EchoWM 创造了一个真正可进入、可操控、可探索的视听一体化世界。
在相关论文报告的 158 个 WBench Navigation 案例评测中,JoyAI-EchoWM 取得了 81.7 的最高平均分,并在一致性(89.8)和交互性(87.2)等指标上位于前列。同时四步因果流式版本 EchoWM-Flash 的平均分为 81.0,交互得分为 87.9,表明减少采样步数后,模型仍具备较强的导航响应能力。
相较于同一评测中的其他模型,Genie 3 强调实时探索与分钟级世界一致性;LingBot-World 2.0 通过因果生成与少步蒸馏推进长时程交互,并结合相机位姿和文本指令控制视角、动作及事件;HappyOyster 将音视频联合生成与实时交互结合,提供导演和第一人称漫游两种模式。JoyAI-EchoWM 的路线特点,兼顾跨视角控制与持续视听体验,为可进入的生成内容提供了更完整的能力组合。
这条技术路线如何体现在交互中,可以从用户按下操作键后,镜头、画面与声音的变化看起。
按下操作键,AI 世界用画面与声音回应你
普通视频生成,生成结束以后任务基本完成。即使主体位置略有漂移、空间关系偶尔变化,只要整体画面自然,人眼未必能察觉到。可一旦允许用户自由移动、切换视角,此前很多可以被视觉效果遮过去的小错误,在交互状态下都可能会变成 Bug。
这是因为,交互给视频生成增加了一层要求:模型需要根据用户操作,生成与此前内容衔接的画面。
JoyAI-EchoWM 如何解决这些问题呢?它的思路是通过共用一套交互接口,让画面中的主体、空间关系和声音随着用户探索一起延续。团队将这一支持持续导航并获得同步视听反馈的模型称为面向「可进入生成媒体」的全模态世界模型。
- arXiv 论文:https://arxiv.org/pdf/2608.23189
- 项目主页:https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/wm/
- GitHub 代码:https://github.com/jd-opensource/JoyAI-Echo
要实现这样的交互,首先需要统一不同视角下的控制方式。第一人称视角下,镜头接近观察者的眼睛,移动镜头对应自身移动。第三人称多了一层关系:镜头要跟随人物、车辆等主体,主体运动也要与画面构图配合。与此同时,用户按下的 WASD 方向键是离散指令,模型需要处理的相机位置和朝向却是连续变化的,为不同视角和控制设备分别设计接口会增加系统的适配负担。
为此,JoyAI-EchoWM 采用了统一的「相机意图」(camera intent)表示,用以描述用户希望镜头如何移动、 从什么角度观察场景。键盘操作经过固定映射,转换为相对初始位姿的连续 6-DoF 轨迹,也就是镜头在 3D 空间中的平移和旋转。
同一条轨迹在不同视角下承担不同作用。第一人称下,它直接描述观察者的运动;第三人称下,它规定相机的变化,人物移动与镜头跟随之间的关系则由模型从数据中学习。模型无需额外接收角色轨迹、控制器状态或相机预设的跟随参数。
第一人称控制方式覆盖了户外、室内、水下和奇幻等多场景。用户可以沿着指定方向移动,让眼前环境逐步展开。如下冰湖探索的演示中,第一人称视角沿冰面不断向前推进,远处的木门逐渐靠近,雪山、森林与湖面倒影持续展开,环境声也随画面同步生成。
视频链接:https://mp.weixin.qq.com/s/DeRINAhowAGMobWR1yz_Ug
第三人称视角展示了镜头与主体的配合。下面荒漠骑马的片段中,骑手向前推进,镜头从后方跟随,并左右移动。
视频链接:https://mp.weixin.qq.com/s/DeRINAhowAGMobWR1yz_Ug
探索过程中,声音同样参与生成。JoyAI-EchoWM 采用原生音视频联合生成,视频和音频分支在生成过程中交换信息,使声音与画面中的场景和事件相互关联。相机轨迹只直接输入视频分支,音频侧没有独立的轨迹条件,也没有额外训练一套「动作 — 声音控制器」。
简单来说,操作先改变画面,声音则根据画面的变化同步跟上。人物等主体讲话时生成对应语音,风、脚步和碰撞等事件伴随相应声响,音乐也随着场景延续。下面橘猫讲话的同时配上了背景音。
视频链接:https://mp.weixin.qq.com/s/DeRINAhowAGMobWR1yz_Ug
当探索进入下一轮,模型还要承接已经发生的内容。JoyAI-EchoWM 会提取上一段末尾的一段同步音视频,作为下一轮生成的上下文。用户在新一轮调整相机轨迹,继续向前探索。后续画面和声音共享同一段近期历史,为场景布局、主体外观和声音的延续提供依据。
这套机制有助于维持连续体验,但仍存在边界。模型目前没有显式的持久三维记忆,多轮生成后,几何关系、主体身份和音频仍可能发生漂移。
视频链接:https://mp.weixin.qq.com/s/DeRINAhowAGMobWR1yz_Ug
要让画面、声音和用户操作在同一个生成过程中形成配合,需要先解决数据与训练上的几道难题。
JoyAI-EchoWM 三重挑战:好看、好控,长时间不跑偏
高质量音视频未必带有准确的相机轨迹,而轨迹可靠的数据也未必拥有丰富的声音。进入持续交互后,模型还要应对误差累积和不断增长的计算开销。JoyAI-EchoWM 从数据引擎入手,通过统一轨迹尺度和分阶段训练,逐步连接起这些能力。
首先是数据。团队采用了四类互补来源,搭建起了一套世界数据引擎,不同数据分别提供更可靠的监督。其中:
- 内部采集的 gameplay 可以同步获得操作日志、原生游戏音频和较清晰的动作 — 观察对应关系;
- 互联网上的人类实玩录像,操作节奏更自然,也包含游戏对白、玩家解说等更丰富的人声;
- UE(Unreal Engine)仿真直接提供米制真值位姿和动作日志,几何监督最干净,但不提供自然音频;
- 普通互联网视频补充真实世界外观、环境声、语音,以及更丰富的镜头和主体关系。
收集数据之后,团队又根据训练目标重新组织了三组数据配比。AV-rich 侧重画面、环境声和语音质量,Control-clean 优先保留轨迹可靠、运动清晰的样本,Balanced high-quality 则从中筛选兼具可靠控制信号和较高视听质量的数据,供后续联合训练使用。
数据来源变多,也带来了尺度问题。不同视频中的相机移动幅度差异非常大,如果每条轨迹都按自身的运动范围单独归一化,大幅移动和小幅移动就可能被压缩到相近的数值区间。原有的位移差异也会丢失,相邻生成片段采用不同尺度时,还可能带来速度突变。
JoyAI-EchoWM为训练轨迹建立了一把统一的「尺子」:先计算每条轨迹的最大平移幅度,再取这些值的第 90 百分位数作为全局尺度。最大平移幅度不超过这一阈值的轨迹被保留,并使用同一尺度归一化;旋转保持不变。这样可以保留不同轨迹之间的相对位移差异,减轻分段定标带来的不连续性。
有了互补数据和统一尺度,接下来的问题是如何安排训练。音视频质量与轨迹控制依赖不同的监督信号,如果同时强化两者,训练目标可能相互干扰。JoyAI-EchoWM 先依照三个阶段分别学习,再共同适配。
第一阶段是音视频持续预训练(AV-CPT),使用 AV-rich 数据训练已有的音视频骨干,使其适应交互场景中的视觉动态、环境声和语音。第二阶段是动作微调(Action-SFT),冻结音视频骨干,只训练轻量的相机轨迹分支,并使用 Control-clean 数据强化轨迹响应。这一阶段使用的控制监督仍然是相机轨迹。第三阶段是联合微调(Joint-FT),使用 Balanced high-quality 数据,以较低学习率共同调整音视频骨干和轨迹分支,让视听生成与控制能力进一步配合,同时尽量减少对已有能力的扰动。
完成以上三个阶段之后,模型还要适应长时间交互。持续生成时,前一段输出成为后一段的输入。早期出现的偏差可能被带入后续内容,从而影响场景、主体和声音。为此 JoyAI-EchoWM 引入了第四阶段:自回归后训练(AR post-training)。
团队首先利用音视频 Teacher Forcing 将双向模型改造为因果分块生成模型。模型学习依据此前的音视频上下文生成下一块同步内容,为流式输出建立基础。随后,短时程 Self-Gradient Forcing(SGF)让模型基于自己生成的历史继续向前生成。同时分布匹配蒸馏(DMD)将多步生成压缩为少步采样,降低每个音视频块所需的去噪步数。训练之后进一步扩展到更长的自生成序列,让模型接触交互中逐步累积的偏差,学习在这些条件下保持连贯。
另外,历史信息的保留也需要控制成本。JoyAI-EchoWM 采用sink-plus-FIFO 机制,固定保留早期的一部分上下文,并滚动维护最近一段历史。较旧的局部缓存按先进先出的顺序移出,限制 KV 缓存规模。
这套方法能在多大程度上兼顾生成质量、控制精度与长时程稳定性,还需要通过系统评测来检验。
从轨迹控制到长时一致性,JoyAI-EchoWM 表现如何?
除了开篇提到的 WBench Navigation,团队还通过 SANA-WM-Bench 和用户研究,进一步考察 JoyAI-EchoWM 的轨迹跟随、长时程生成与主观体验。
SANA-WM-Bench 将测试分为简单轨迹和困难轨迹,每组包含 80 个场景。评测同时关注画面质量与相机控制,分别统计 VBench 视觉质量得分,以及旋转、平移和相机运动一致性误差。
在前 241 帧的短时程测试中,JoyAI-EchoWM 在两组轨迹上的 VBench 得分分别为 83.91 和 83.96,均为测试模型中的最高值。简单轨迹下,其平移误差和相机运动一致性误差也最低。而困难轨迹下,SANA-WM 的相机控制误差更低,JoyAI-EchoWM 保持了较高的视觉质量。
当生成延长到 961 帧,测试进一步检查模型回到相近相机位姿时,画面能否前后对应。在这一长时程设置下,四步因果流式版本 EchoWM-Flash 的 VBench 得分分别为 80.13 和 81.06,在测试的因果模型中领先,轨迹精度和视角重访一致性也表现突出。
此外团队还在自建的 200 案例测试集上进行成对用户研究,比较 JoyAI-EchoWM 与 LingBot-World-v2、HappyOyster 的生成表现。评测涵盖语义遵循、初始世界一致性、运动、时空一致性、视觉美感和整体偏好,并保留「两者都好」、「两者都差」选项。
其中在整体偏好结果中,相较于 LingBot-World-v2,选择 JoyAI-EchoWM 的占 46.50%,选择对方的占 21.57%;相较于 HappyOyster,这两项指标分别为 63.13% 和 27.06%。需要注意的是,这些比例统计的是评价选择,不能直接理解为任务成功率。
分项结果也体现了不同模型的特点。JoyAI-EchoWM 在时空一致性和视觉美感上获得更多偏好;HappyOyster 在语义遵循和运动两项中,被单独选为更优的比例更高。
评测让我们看到了 JoyAI-EchoWM 的表现与边界,也为判断它适合进入哪些实际场景提供了依据。
世界模型走向不同的应用场景,带来了技术路线的逐步分化。面向互动内容,生成速度与操作响应直接影响体验;面向空间创作,几何一致性和场景编辑能力更关键;面向机器人,模型要为预测环境变化和执行动作提供支持。因此,判断一个世界模型的价值,需要看它能在具体任务中解决哪些问题。
以 Genie 3、Atlas、Cosmos 3 为例,这些方向存在交集,也有不同的技术取舍。随着应用深入,持续交互、空间表示与行动能力之间的配合至为关键。在这一背景下,JoyAI-EchoWM 的定位更接近面向生成媒体的可交互世界模型。
从当前能力看,游戏原型可能是 JoyAI-EchoWM 较有潜力的应用方向。创作者可以进入生成场景,尝试空间布局、路线设计与镜头体验,再决定后续制作方向。当然,一个可以探索的世界距离成熟游戏仍有距离,玩法、规则和任务设计都需要继续补齐。
另外,互动叙事、沉浸内容和虚拟游览也有机会借助 JoyAI-EchoWM 减少预制素材需求,让内容按照用户选择持续生成。数字人场景则可以探索动态环境与镜头、声音的协同生成,使人物表演与周围视听内容共同展开。
将视线拉回京东,JoyAI-EchoWM 是其基础模型矩阵升级的一部分。京东在 JDD 大会上全新展示了 JoyAI-Video 音视频基础模型,并带来了JoyAI-Echo 1.5、JoyAI-Voice 2.0 等版本迭代。结合此前发布的 JoyAI-Video-Edit 与 JoyAI-Image-Edit、JoyAI-Talker 和 JoyAI-RA,京东的布局已经全方位铺开。JoyAI-EchoWM 带来的世界模型与音视频能力,使这套体系进一步覆盖对环境的理解、生成和交互。
立足这一布局,京东正在为 AI 进入物理世界补齐相互补充的基础能力。同时,模型矩阵的长期价值取决于这些能力能否在具体任务中有效协同,并通过真实场景反馈持续改进。这呼应了京东建设「全球最大的物理世界运营中心」的战略目标。对拥有零售、物流等优势业务场景的京东来说,接下来的看点是如何将模型能力用于实际流程,并验证其可靠性、成本与效率。
JoyAI-EchoWM 的开源既为可交互视听生成提供了一套可供社区借鉴的方案,也让这条技术路径有机会接受更多真实场景的检验。
热门跟贴