导语(The Hook)

长视频生成领域有三大老大难:误差累积让画面越生成越糊、角色跨镜头就换脸换声音、长时域推理慢到没法用。2026 年 8 月底,京东 Joy Future Academy 团队把 JoyAI-Echo 1.5 整体开源:一个仓库装了两个模型——Echo-LongVideo能生成 10 分钟以上多镜头连贯音视频,角色长相和声音全程在线;Echo-WM则是一个"可进入"的全模态世界模型,用键盤断断续续地开、转向、后退,它就同步吐出 720p 画面 + 环境音 + 音乐 + 语音。世界模型变体在世界模型权威基准WBench 上以 81.7 平均分排名第一,把 Genie 3(73.9)甩在身后。代码、权重、ComfyUI 支持、UE 数据管线,这次全部放出来了。

硬核科普(Tech Wiki)

时域音视频生成(Long-Horizon Audio-Visual Generation)

一句话定义:让模型一次生成几分钟到十几分钟的音视频,且角色外貌、声音、场景在镜头切换间保持一致。

类比说明:就像一个剧组要拍 10 分钟短片,前一个镜头的主角和配乐,观众在下一个镜头里必须一眼认出来——现在的视频模型经常"换了机位就换了主角"。

为什么难:扩散模型一次只能生成几秒到几十秒,靠"接着上一段续写"拼长视频时,误差会逐段累积,一致性随之崩塌。

可进入的全模态世界模型(Enterable Omnimodal World Model)

一句话定义:不只是"看"预渲染的视频,而是用户通过相机控制实时"走进"生成出来的世界,画面、环境音、音乐、语音跟着你的操作同步演化。

类比说明:传统视频生成像看电影,世界模型像玩开放世界游戏——区别在于,这个世界不存在于任何硬盘上,它是由模型实时"想象"出来的。

相机意图(Camera Intent)与 6-DoF 轨迹

一句话定义:把键盘按键、游戏手柄、连续姿态等五花八门的控制输入,统一翻译成度量尺度的相对 6 自由度相机轨迹(前进、横移、升降、俯仰、偏航、翻滚)。

类比说明:就像给不同的"方向盘"配了一个统一的"行车记录协议"——不管你用什么设备开车,系统记录的都是标准化的位移和转向。

Self-Gradient Forging(SGF,自梯度强制)

一句话定义:一种让模型用"自己生成的结果"作为上下文继续训练的后训练技术,配 Teacher Forcing(教师强制)逐步过渡,解决自回归推理时"训练和推理看到的数据分布不一致"问题。

类比说明:先让徒弟抄老师傅的成品学习(教师强制),再让徒弟独立干活、师傅在旁边指着偏差纠正(SGF),最后徒弟能又快又稳地独立出师。

核心突破:JoyAI-Echo 1.5 深度拆解

JoyAI-Echo 1.5 不是一个模型,而是基于 LightricksLTX-2骨干构建的统一系统,拆成两个专门变体,分别攻"长叙事"和"交互世界"。两篇论文同时放出:arXiv:2608.23383(系统总述)和 arXiv:2608.23189(EchoWM 世界模型专述)。

打开网易新闻 查看精彩图片

图 1:EchoWM 的"可进入世界"概念图——给定参考观测、结构化世界描述和以相对 6-DoF 轨迹表示的用户控制序列,单一模型同时支持第一/第三人称交互、同步环境声与语音、多轮续播。这张图值得看的原因:它是整个工作的"世界观",后面所有设计都服务于"让生成媒体可以被走进去"这个目标。

痛点:为什么之前的方法搞不定?

关键瓶颈

跨镜头一致性:多镜头长视频里,角色外貌和声音随镜头切换漂移;1.0 版本的音频记忆用短窗口采样,容易被背景音乐"污染"。

控制器绑定:已有世界模型(如 Genie 系列)把交互绑定在特定动作标签上,换一个控制器就得重新定义动作空间,第三人称角色控制更是需要专门设计。

长时域效率:双向扩散骨干做自回归续写,多步采样让 10 分钟生成的延迟高到不实用。

方案一:Echo-LongVideo,用"组合式跨镜头记忆"锁住角色

架构创新

视觉记忆:从同一角色的场景不相交片段中采样单帧,经视频 VAE 编码后作为记忆 token 注入。

音频记忆:不再用短窗口,而是对完整镜头音频先做语音过滤(MSST 工具包)再编码,把"这个人说话是什么音色"干净地提取出来,避免背景音乐主导。

RoPE 分区:目标 token 放低偏移区(<500),历史记忆按镜头依次放在 500、550、600……初始记忆放 ≥5000 的高偏移区——用位置编码给记忆"排座位",让注意力知道谁是谁。

四种条件组合:文本生音视频(T2AV)、图像生音视频(I2AV)、记忆+文本(MT2AV)、记忆+图像+文本(MTI2AV),统一接口联合训练。

训练策略:两阶段数据课程——Stage I 用身份中心的"记忆语料"教会模型检索记忆,Stage II 用无字幕、多分辨率(720×720 / 1280×720 / 720×1280)、扩充中文的数据增强通用质量与转场建模。质量过滤包括学习型感知评分、拉普拉斯锐度、OCR/贴片过滤、光流统计和基于感知哈希 + DINOv2 的身份级去重。

打开网易新闻 查看精彩图片

图 2:记忆条件化长视频生成与少步加速总览。上半部分是统一条件化接口(单帧视觉记忆、语音过滤音频记忆、分离的 RoPE 坐标),下半部分是记忆鲁棒的联合 DMD 蒸馏——非对称优化(视频全量微调、音频 LoRA)加上音频专属对抗与 RMS 能量约束。对应正文"方案一"整段。

少步加速:多步教师蒸馏成8 步学生生成器。蒸馏做了三件讲究事:①非对称优化——视频分支全量微调,音频分支和跨模态注意力只动 LoRA;②粗到细噪声调度——先高 shift + 大学习率搭视频结构,再低 shift + 小学习率磨音频细节;③训练时对视觉记忆做随机退化,保证推理时记忆质量稍差也能稳住。

方案二:Echo-WM,用"相机意图"统一所有交互

架构创新

统一 6-DoF 接口:键盘指令经固定映射转为局部线速度/角速度增量,SE(3) 积分成轨迹;连续姿态直接进入同一表示。选轨迹而非动作标签的三个理由:数据覆盖广、没有控制器相关的逆映射歧义、保留了垂直运动和翻滚这类连续自由度。

全局尺度校准:不同来源数据的运动幅度差异巨大(动作数据平移幅度中位数 12.7,带语音数据只有 3.9),团队用全数据集统一的 90 分位数做平移尺度校准,避免逐片段归一化抹掉位移差异或造成续播边界尺度突变。

UCPE 注入:相对 6-DoF 轨迹通过统一相机位置编码(UCPE)注入注意力,一半通道走射线几何变换、其余保留 RoPE;相机分支零初始化,与视频自注意力并行,只作用于视频 token。

第一/第三人称通吃:第一人称中轨迹直接控制观察者;第三人称中相机—角色的耦合动态直接从数据学出来,不需要为每个视角设计专用控制器——人类、动物、其他前景主体都用同一套接口。

打开网易新闻 查看精彩图片

图 3:EchoWM 总体架构。左:异构输入(键盘、动作日志、估计位姿)统一为校准后的相对 6-DoF 轨迹事件流;中:相对 UCPE 分支注入视频自注意力;右:AV-CPT → Action-SFT → Joint-FT → 自回归后训练的四阶段课程。这是全文技术密度最高的一张图。

四阶段渐进训练

AV-CPT:全骨干在音视频富集数据上预训练,保留完整标注;

Action-SFT:冻结骨干,只训相机分支——数据换为控制干净混合,并刻意移除 narrative 类运动文本,防止模型从文本提示里"抄答案"而非听控制;

Joint-FT:两组参数低学习率端到端联合微调;

自回归后训练:音视频教师强制 → 短时程 SGF(配 DMD 蒸馏压成4 步采样)→ 长时程 SGF(段间末帧继承、sink+FIFO 有界 KV 缓存、层级式长程梯度路径)。

数据引擎:四个互补数据源——内部采集游戏录像(原生音频+动作日志)、互联网人类游玩录像(自然控制时机+语音)、UE 仿真(真值度量位姿,1 个第一人称 + 4 个第三人称机位)、通用网络视频。位姿恢复用 ViPE + VGGT-Omega + MoGe-2 在约 1 分钟长窗口上优化,标注由 Qwen3-Omni 与 Gemini-3-Pro 完成并规范化为七个结构化字段。仓库在 2026 年 9 月 4 日进一步放出了这条 UE 仿真管线的代码(物理轨迹生成 + Movie Render Queue 渲染 + 分布式调度)。

方案三:Director Agent,把长片生成变成"剧组流水线"

对超过 10 分钟的长片,系统引入 Director Agent:从开放式用户意图出发,自动完成剧本开发 → 镜头计划 → 提示增强 → 逐镜头生成 → 分层审查与实时干预 → 镜头通过后记忆准入→ 组装交付。持久项目工作区支持从任意中间镜头恢复;默认全自主,也留了人类在环的检查点。

打开网易新闻 查看精彩图片

图 4:Director Agent 闭环——注意"镜头通过后记忆准入"这一步:只有审查合格的镜头才会写入跨镜头记忆库,污染记忆的坏镜头被挡在门外,这是长片一致性的工程保险。

效果:实验证明了什么?

关键指标(WBench Navigation,158 例,0–100 分):

模型

Avg

Quality

Setting

Interaction

Consistency

Physical

EchoWM

81.7

81.5

79.4

87.2

89.8

70.6

EchoWM-Flash

81.0

81.1

88.3

87.9

77.5

70.1

HiDream-O1-World

80.9

81.0

82.2

80.0

88.0

73.3

Genie 3

73.9

EchoWM 平均分第一,Flash 版的 Interaction(87.9)为全场最高——少步蒸馏几乎没有牺牲交互跟随。

SANA-WM-Bench(241 帧短时程):VBench Overall 达 83.91(Simple)/ 83.96(Hard),超过此前最佳的 DreamX-World(82.42 / 82.03);平移误差 T=0.160、CMC=0.162 均为领先水平。

961 帧长时程:Simple 拆分 VBench 81.36 为全场最高,重访一致性 revisit PSNR 达15.10 dB(最高),成像质量衰减 ΔIQ 仅 0.02——通俗说:走了一圈回到原地,场景基本还是原来那个场景。961 帧因果流式版本(EchoWM-Flash)VBench 80.13 / 81.06,均优于 Evoke、LingBot-World-v2、SANA-WM ± Causal Refiner。

用户研究(200 例):对比 LingBot-World-v2 总体偏好胜率 46.50% vs 21.57%;对比 HappyOyster 胜率 63.13% vs 27.06%,其中自动驾驶(75.00%)和多社交场景(81.25%)大幅领先。

打开网易新闻 查看精彩图片

图 5:Echo-LongVideo 的 10 分钟级多镜头生成样例——跨镜头的角色外貌与声音一致性直接看图说话,这正是"组合式跨镜头记忆 + 语音过滤音频记忆"交付的效果。

局限性与适用边界(作者自己承认的部分)

Hard 拆分上的旋转误差:961 帧 Hard 拆分中旋转误差 R=12.05°,略逊于 SANA-WM 的 10.02°——难轨迹下的精确转向还有差距。

语义跟随弱项:用户研究中对 HappyOyster 的语义跟随胜率仅 13.63%(对 29.44%),具身机器人场景下更是只有 8.67%——纯指令语义理解的短板被对手抓住了。

域外泛化的边界:训练数据不含 2D/2.5D 游戏与机器人数据,虽然论文展示了超出训练域仍保持视角演化一致,但这属于未经专门优化的"意外泛化"。

许可证限制:基于 LTX-2 构建,JD 的修改部分仅限学术研究和非商业用途,商用需联系 Lightricks。

技术溯源与关联工作团队脉络

Joy Future Academy(京东)联合 HKUST、PKU、HKU、THU、USTC、FDU、北航、斯坦福等机构完成。值得注意的作者签名:Lvmin Zhang(ControlNet 一作、LTX 系列核心开发者)和 Zeyue Xue 出现在 EchoWM 作者列表中——这也解释了为什么整条技术栈能如此深度地构建在 LTX-2 上。

时间

工作

核心贡献

2026-06

JoyAI-Echo 1.0

长音视频生成框架,系统提出误差累积、一致性、延迟三大问题(现归档于 echo1.0 分支)

2026-08

JoyAI-Echo 1.5 / Echo-LongVideo

组合式跨镜头记忆 + 8 步 DMD 蒸馏 + Director Agent,10 分钟级生成

2026-08

EchoWM

可进入全模态世界模型,WBench 登顶

2026-09

UE 数据引擎管线

世界模型的物理轨迹生成 + 渲染 + 分布式调度开源

技术演进路线

从 1.0 到 1.5 的三个关键改进

音频记忆从短窗口升级为"语音过滤后全镜头",声音一致性显著增强;

双向骨干通过渐进式教师强制 + SGF 转化为因果少步生成器(4 步),长时域推理从"不实用"变"可用",并给出消费级 GPU 推理配置;

交互从无到有:世界模型变体引入统一相机意图接口,且开源路线图明确接下来迁移 LTX-2.5 骨干、用稀疏注意力 / Paged KV-cache / FP8-TensorRT 继续砍长 rollout 成本。

资源直达

论文 1(系统总述,JoyAI-Echo 1.5):https://arxiv.org/abs/2608.23383

论文 2(EchoWM 世界模型):https://arxiv.org/abs/2608.23189

GitHub 仓库(代码 + 权重入口 + UE 管线):https://github.com/jd-opensource/JoyAI-Echo

项目主页:https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/

京东探索研究院:https://research.joyai.com/

代码、HuggingFace 权重、ComfyUI 支持均已开源(学术非商用许可)。

关注我们,第一时间追踪具身智能与生成模型前沿干货。

Mbot具身智能实验室

让尖端科技触手可及,人人皆可探索未来

打开网易新闻 查看精彩图片

Mbot基础交流群等你加入,下方扫码联系

具身-杰西

Mbot具身-小助手

Mbot-视频号

Mbot-公众号