要说过去一年AI领域讨论最热的方向,世界模型必须占有一席之地。
在过去18个月里,世界模型企业吸纳了超过100亿美元的投资,图灵奖得主杨立昆(Yann LeCun)甚至预言三到五年内它将取代大语言模型成为主流AI范式。
与此同时,世界模型的技术瓶颈正在暴露。
长期记忆能力薄弱、相机控制精度不足、实时交互能力有限,多数产品停留在“生成视频”而非“交互世界”的阶段。更重要的是,市面上的世界模型普遍缺乏对物理规则的理解,例如模型能生成一条狗跑动的画面,却不明白狗的四条腿为什么按这个顺序落地。
就在这种混乱中,昆仑万维旗下Skywork团队在7月19日世界人工智能大会WAIC 2026期间,正式发布了世界模型Matrix-Game 3.5。
该模型能够根据用户动作和事件指令持续生成可交互的世界,并在长时序生成过程中保持场景结构、空间布局、角色身份和动态内容的一致性,为游戏、机器人、具身智能和 XR 等应用提供可持续交互的生成基础。
一、三方面升级,实现端到端实时推理
3.5版本从模型吞吐优化、DiT推理优化和VAE解码优化三个层面构建了完整的系统级加速方案,实现端到端实时推理。
首先,在模型吞吐优化方面,Skywork团队通过蒸馏将采样步数压缩至3-step Sampling,并设计分块因果推理(Chunked Causal Inference),结合KV Cache、Patch Latent和预测Latent,在保持生成质量的同时提高单次推理吞吐,显著降低多步采样带来的整体延迟。
其次,在DiT推理优化方面,Skywork团队还针对推理热点进行了系统优化,包括FFN INT8量化、Memory Retrieval Optimization以及Torch.compile等推理加速技术,在几乎不影响模型效果的情况下进一步降低DiT推理耗时。
最后,在VAE解码优化方面,Skywork团队使用3.0版本中的MG-LightVAE,对Wan2.2 VAE Decoder进行约75%结构化剪枝。在保持与原始Wan VAE接近重建质量的同时,该架构可以大幅降低VAE解码延迟,使VAE不再成为系统整体性能瓶颈。
通过上述系统级优化,Matrix-Game 3.5实现了减少采样步数+DiT推理优化+VAE加速的完整推理加速方案,最终在单张GPU上实现720P分辨率、约20FPS的实时流式视频生成。
二、四大技术优势,解决长时一致性问题
据Skywork团队披露的信息,Matrix-Game 3.5还有四个核心差异化优势。
1、长期记忆机制
对于长期记忆,Matrix-Game早期版本的做法是原样存储历史帧,推理时检索相关帧拼接到上下文中——占用大量上下文窗口,跨帧拼接时容易出现画面冲突。
3.5版本将历史帧切分为三维坐标系下的空间块,检索时按空间位置匹配,再重组成当前视角的记忆图。画面一致性更高,相机轨迹更稳定,记忆可以随时更新、替换、删除。
Matrix-Game 3.5的Patch Memory是业内首个几何对齐的Patch级长期记忆机制。
行业评测显示,主流世界模型的“物体重现得分”没有一个超过0.6,即相机离开再回来,场景里的物体可能就消失了。
Patch Memory可以将局部图像patch作为基本记忆单元,在空间上按需检索、对齐和复用历史内容,让模型在相机重访场景时能准确找回此前观察过的空间内容。
2、动静解耦记忆机制
此外,该模型采用动静解耦记忆机制,让Patch Memory负责记住静态场景结构,主体参考Token负责维持动态主体的身份一致性。动态物体在写入记忆前会被过滤掉,避免移动物体被误认为多个静态物体。
3、相机控制精度
传统视频模型使用的3D RoPE只编码时间和二维空间位置,难以表达不同视角之间的真实几何关系。Skywork团队发现,此前把鼠标信号通过Self-Attention注入、键盘信号通过Cross-Attention注入的做法,虽然直观,但每次加入参数都会破坏模型对原始视频分布的认知,需要大量额外训练来修复基础能力
在架构层面,3.5版本做了一个关键调整:不再将动作控制信号作为额外参数注入模型,而是采用相机位姿相对编码PRoPE机制,通过相机投影矩阵让模型直接感知相机相对位姿。
Matrix-Game 3.5将PRoPE加Warped RoPE进行组合,其中Warped RoPE可以重新定义记忆Patch在当前视角下应该出现的位置——位置编码从简单的时空索引升级为具备几何语义的世界表示。
4、轻量化框架
轻量化的交互框架是Matrix-Game 3.5另一个值得注意的特点。除角色Reference Adapter外,该模型的核心功能几乎不需要新增模型参数即可实现交互世界建模,并可快速适配不同的视频基础模型。
三、让行业头疼的数据,成了护城河
除了以上技术优势,Matrix-Game 3.5还有一个很值得细说的“技术护城河”,就是其在数据基础建设上的成果。
如果说大语言模型的瓶颈是算力,那么世界模型的瓶颈首先是数据。
互联网视频的数据分布与世界模型需要的物理世界数据存在本质差异:互联网内容很多是娱乐性的,甚至包含反物理规律的内容,比如人也可以飞起来。
而世界模型需要的是接触丰富、包含推拉拧拽等动作、涵盖柔性物体、摩擦力、流体等多样物理交互的真实数据。
更棘手的是数据规模。国际领先大语言模型的预训练数据已达100万亿Token,等效约100亿小时的说话量。
物理世界数据的信息密度远低于文本,要实现更高阶的物理常识判断,可能需要“亿小时”量级的真实世界数据。
对于数据采集,Skywork团队给出的解决方案是三条自动化数据生产管线:
1、第一条基于Unreal Engine 5的自主探索管线,在UE5中搭建常见游戏场景,部署RL Agent进行自由探索,在探索过程中实现毫秒级同步采集,完整记录视觉画面、动作状态及相关语义信息。
2、第二条是跨游戏自动化控制与探索管线,覆盖《GTA V》《荒野大镖客2》《赛博朋克2077》等主流3A游戏,实现跨游戏的自动控制、自动探索、自动录制与自动标注。
3、第三条是开放平台视频自动挖掘管线,从开放平台自动获取游戏视频,通过VLM评分筛选高质量片段,自动完成镜头切分、过滤与结构化标注。
此外,Skywork团队构建了自动化的离线标注管线,为每条视频估计相机位姿(Camera Pose)、米制深度(Metric Depth)以及相机内参。
Skywork团队还构建了基于多模态大模型的视频Prompt自动标注系统,该系统以固定长度的视频窗口作为标注单元,通过抽取关键帧理解场景内容,并生成覆盖整个窗口的统一描述,在保证时序一致性的同时显著降低了标注成本。
为了评估数据质量,Skywork团队搭建了Scene-Quality自动评估系统,可以对每个场景进行多维质量分析,并输出统一的质量评分。
四、不到两年四次迭代,被英伟达和Adobe作为基准
Matrix-Game系列从1.0到3.5,进化路径非常清晰。
2025年3月,昆仑万维发布的Matrix-Game 1.0版本是早期可交互世界模型的一次概念验证;
2025年8月,该系列模型发布2.0版本,实现了单卡B100、720P分辨率下25FPS的实时交互,成为业界首个开源方案;
Matrix-Game 3.0版本在2026年3月发布,5B参数蒸馏模型实现了720P下40FPS的实时生成,补齐了世界模型公认的三大短板——记忆、长时程、实时性。
此次正式发布的3.5版本的最大变化是从游戏场景向真实场景全面扩展,它支持多风格动态切换与指令控制,引入了NPC交互能力,并全新升级了长时记忆能力。
更难得的是,Matrix-Game始终坚持开源策略。
此前,DiT作者、纽约大学助理教授谢赛宁团队基于Matrix-Game 2.0的开源底座,发布了全球首个多人视频世界模型Solaris,也从学术圈的实际使用上印证了这套开源方案的基础模型价值。
英伟达和浙大联合发布的工作Light Interaction同样是基于Matrix-Game 3.0模型进行研发。另外,英伟达的SANA-WM和Adobe的RELIC等国际头部大厂世界模型工作,均将Matrix-Game相关模型作为对比基准。
结语:昆仑万维的目标,是更广阔的物理世界
昆仑万维董事长兼CEO方汉给出判断:2026年是“世界模型元年”。这个判断意味着,在今年,世界模型的道路或许会逐渐收束,数据、训练的难题也会被逐一攻破。
Matrix-Game 3.5的定位正是回应这个判断。它不是只做渲染,也不是只做规划,而是把状态理解和动作生成放在同一个框架里训练,让模型同时学会“理解世界”和“行动于世界”。
Matrix-Game 3.5同时也是昆仑万维“4+3”AGI战略的核心组成部分。在这一战略框架下,视频模型SkyReels、音乐模型Mureka、世界模型Matrix-Game、基座文本与多模态模型构成了四大技术底座,AI短剧、AI音乐、AI游戏三大平台经济体则承载着商业化落地。
在WAIC 2026的专场论坛上,昆仑万维集中完成了四大核心模型的全球首发——世界模型只是其中的一块拼图,但也是最关键的那块。
Matrix-Game 3.5正式亮相后,行业关注的将不只是它的技术参数,还有它能否真正跨越游戏与物理世界之间的那道门槛。
昆仑万维的目标,其实指向的是更广阔的物理世界。
热门跟贴