编辑|泽南
刷短视频时,我们吐槽 AI 视频的 bug;听 AI 写的歌,总觉得缺了「人味」;仔细看机器人的 demo,会发现它们其实还不太会做家务……人工智能这些看似不相关的短板,本质上都指向同一个问题:它们还没有真正理解真实世界的运行规律。
这个困扰全行业的难题,在 WAIC 得到了一份体系化的回答。7 月 19 日,一场专场论坛上,昆仑万维董事长兼 CEO 方汉提出一个核心论断:2026 年是世界模型元年。
支撑这句论断的,是一套横跨虚拟与物理世界的全模态模型矩阵。
当 AI 拥有了对真实世界的统一认知能力,数字内容创作与物理世界交互的边界,都将被彻底重构。
今年的 WAIC,世界模型成为胜负手
作为 AI 产业的年度风向标,世界人工智能大会(WAIC)的热闹肉眼可见:1100 余家参展企业、超 300 款全球首发产品,几乎所有主流科技公司都把年度压箱底的成果搬来了现场。热闹的展区背后,整个行业的路线分野已经非常清晰。
算力赛道在卷集群规模:华为拿出 8192 张卡组成的昇腾超节点,中科曙光、沐曦等厂商扎堆上新超算产品,比的是万卡级集群的工程能力与算力密度;机器人赛道在卷硬件形态:智元推重载人形,启元做可变形机器人,多数玩家仍在本体性能、特定场景专用性上贴身肉搏;大模型赛道在卷参数效率:月之暗面的 2.8 万亿开源模型 Kimi K3,让国内模型与世界第一的差距已经从 3-6 个月缩短到了几周。
作为 AI 领域最前沿的方向,世界模型也正在从学术概念走向产业落地。但多数玩家仍停留在垂直场景的单点尝试:有人做 AI 影视,有人做植物仿真,却很少有人回答一个最根本的问题:能不能用一套统一的世界认知能力,同时解决数字内容、具身智能等多个领域的底层难题?
其实,有人早在四年前就开始布局这条路线。
今天昆仑万维的集中发布是其 AI 战略四年演进的关键里程碑:从 2022 年确立 All in AGI 与 AIGC 战略,率先押注全模态内容生成赛道,到 2026 年方汉正式提出「世界模型元年」的行业判断,昆仑万维完成了从多模态内容生成到可交互世界模型的战略跃迁,不再满足于让 AI 生成孤立的文本、图像、音频内容,希望通过让 AI 真正理解世界的运行规则,构建打通数字内容与物理实体的统一认知底座。
在所有参展企业中,昆仑万维是唯一一家在同一场论坛中,集中发布横跨世界模型基座、数字内容创作、具身智能三大领域的全模态模型矩阵的企业。
这套全模态布局有着清晰的逻辑:
- 在物理世界层面,由Riemann-1.0 具身动作模型将时空理解能力延伸到机器人控制,构建了跨本体泛化的机器人通用大脑;
- 在基座层,Matrix-Game 3.5 实时交互世界模型打造底层认知能力,尝试解决世界模型的长时序一致性与实时交互难题;
- 在数字内容层,Mureka V9.5 与 O3把认知与推理能力落地到音乐创作领域,推动了 AI 音乐从生成工具向创作范式升维。
从虚拟到物理,从基座到场景,一套完整的世界模型落地体系已然成型。
Riemann-1.0,做机器人的 「通用大脑」
这一路线的价值,先在最复杂的物理世界得到了验证。
很长一段时间里,具身智能都逃不出仅限 Demo 的尴尬:换个桌面、换件衣服,它就不会操作了,长流程任务更是频频出错。问题的根源在于 AI 不懂物理规则,也没有泛化能力,换个场景就得重新学。
WAIC 上,昆仑万维旗下独立公司黎曼机器人带来的 Riemann-1.0 正在打破这个困局。
现场演示中,它能稳定完成有序积木堆叠:
能处理物件繁杂的厨房整理:
Riemann-1.0 将世界模型的能力边界从数字世界延伸到了物理世界,致力于打造一款可跨本体、跨任务、跨场景的 World Action Model(世界动作模型),成为所有机器人的通用大脑。
在 Riemann-1.0 之前,机器人智能的技术路线已经历了两代演进:第一代是专用策略模型,针对特定任务、单一机器人本体端到端训练,泛化能力差、训练效率低;第二代是 VLA(视觉 - 语言 - 动作)模型,引入大语言模型的语义理解能力,把「看懂任务」和动作生成连接起来,但仍缺乏对物理时空动态的深层理解。
Riemann-1.0 所代表的第三代路线 WAM(世界动作模型)如今更进一步,将机器人动作生成、环境状态演化与未来多视角视觉预测纳入同一个因果生成框架,让模型同时掌握执行动作的策略与预判视觉后果的能力,实现世界理解、未来预测与闭环控制的一体化学习。
具体到架构设计上,Riemann-1.0 构建了统一的动作 - 视频联合建模体系:
模型以 Wan2.2 latent-space DiT 为主干,在继承其高质量视频潜空间建模能力的基础上,进一步引入动作 token、状态 token、本体专属映射模块以及动作预测头,实现了对不同机器人形态、传感器配置和连续动作空间的统一适配。
这种设计的核心价值在于让机器人具备了「预判动作后果 - 实时修正决策」的主动认知能力。
为此在数据基建上,Riemann-1.0 构建了一套覆盖三类来源的多源数据聚合矩阵,包括人类第一视角视频、UMI / 外骨骼手套数据以及机器人轨迹数据,总规模达 23.2 万小时,解决了数据规模、泛化性与监督精度三大问题。
为了将异质性极强的多源数据转化为可统一训练的高质量样本,团队搭建了全自动的六阶数据清洗引擎,首次验证了「海量人类视频预训练 + 少量机器人数据微调」的技术路径可行性,用低成本、规模化的人类交互数据尝试解决泛化问题。
在训练上,Riemann-1.0 采用了三阶段渐进式策略: LAM 伪动作预训练 + 真实动作监督训练 + 机器人策略增强训练。
无论是仿真基准还是真机实测,Riemann-1.0 都展现出了显著的领先优势,尤其在长时序操作、视觉泛化与跨场景迁移等体现通用能力的维度上优势突出。其在 LIBERO 基准上成功率达到 99.0%,处于行业第一梯队;RoboCasa-365 基准成功率达 62.6%,领先此前 SOTA 模型 8.4%;RoboTwin2.0 基准:成功率达 94.3%,展现了稳定的双端联合建模能力。
更具说服力的是人类数据有效性的消融实验:在相同机器人示教数据量的前提下,加入人类第一视角数据预训练后,模型在长程已见场景的成功率提升了 28.15%,长程未见场景提升了 16.97%;对比业界基线 EgoVLA,Riemann-1.0 在长程任务上领先幅度超过 25%。
这证明新模型的性能提升源于通用世界理解能力的增强,人类交互经验确实能够有效转化为机器人的操作泛化能力。
机器人能在物理世界做到稳定泛化,本质上依赖的是对空间、几何、因果的底层认知能力,这套能力的源头来自昆仑万维打磨多年的数字世界基座。
Matrix-Game 3.5,破解世界模型长时序一致性难题
从视频生成到世界模型,近期整个行业一直卡在同一个瓶颈:AI 只能生成短时间连贯的画面,镜头一转、场景一换,结构就乱了。想要做实时交互的开放世界,更是会出现空间错位、物体穿模、记忆丢失等一系列问题。
WAIC 现场展示的 Matrix-Game 3.5,正在把可交互的开放世界从概念变成可落地的基础设施。
它可以生成结构自洽、可自由探索的复杂物理场景:
也能生成空间精准、支持实时交互的 FPS 游戏地图:
作为全模态模型矩阵的基座层核心,Matrix-Game 3.5 是整套技术体系的「世界认知底座」。它是一款能够持续交互、具备长期空间记忆的实时流式世界模型。其核心目标是推动 AI 进化成为能生成可持续探索交互,且时空自洽的开放世界。
这也是行业公认的下一代 AI 演进方向。
近几年来,世界模型的技术路线经历了清晰的代际变革:2023-2024 年以 Sora、Veo 为代表的视频模型爆发,到 DeepMind Genie 系列逐步实现了从 2D 到 3D、从离线到实时交互的突破,全行业正在进入「可交互世界」的新阶段。
在这个过程中,Matrix-Game 系列始终沿着开源可落地的路线同步推进:从业内首个实现单卡实时交互的 Matrix-Game 2.0,到首个系统性解决记忆问题的 3.0 版。本次升级的 3.5 版正在将世界模型转化为可被产业低成本复用的通用基础设施。
Matrix-Game 3.5 从记忆机制、几何编码到动静关系完成了底层架构升级,系统解决了长期困扰世界模型的长时序一致性差、相机控制不稳、动态物体易失真三大核心痛点。
首先是长时序生成的场景一致性。此前行业主流的 Frame 级记忆方案要么以整帧特征为记忆单元,跨视角对齐精度不足;要么依赖全局三维重建,灵活性差且容易累积全局误差。
Matrix-Game 3.5 带来的 Patch Memory 技术兼顾精度与灵活性,它将历史图像切分为多个局部 Patch,结合米制深度与相机位姿,把每个 Patch 反投影到三维世界坐标系中存储。当生成新视角画面时,再根据当前相机视锥,检索可见区域的历史 Patch 并重新投影到目标视角,形成空间记忆画布注入模型。
这套机制带来了更精准的空间记忆、更高的自由度、灵活的场景编辑能力,以及稳定的长时间生成。
另一方面,传统视频模型依赖的 3D RoPE 仅能编码时间与二维空间位置,无法表达不同视角间的真实几何关系,这会导致 AI 生成视频常出现相机运动混乱、视角逻辑不自洽的问题。
Matrix-Game 3.5 创新性地提出了 PRoPE(相机位姿相对编码)方案,其直接将相机投影矩阵融入 Transformer 的位置编码体系,让视角几何关系成为注意力机制的天然组成部分。模型在建立跨帧关联时,不仅能理解时序与空间位置,更能感知不同视角间的旋转、平移与投影关系,从而实现更稳定、更精确的相机运动控制。
这套方案无需增加模型参数,最大程度保留了基础视频模型的原生生成能力,同时可快速迁移适配不同的视频基座模型。配合 Warped RoPE,记忆 Patch 会按照三维几何关系映射到当前视角的对应位置,而非保留原始图像坐标,最终形成了统一的几何感知世界建模框架。
在交互式开放世界中,静态环境需要稳定的空间结构,动态主体则需要保持身份与外观的连贯性。如果将两者混合存储,移动的人物、车辆很容易在记忆中留下重影,造成场景污染。
对此,Matrix-Game 3.5 采用动静解耦的双分支记忆设计,静态场景分支由 Patch Memory 负责,存储建筑、地形、固定物体等稳定的空间结构,保障场景的空间一致性;动态主体分支由主体参考 Token 负责,系统从数据中提取多视角、多姿态的主体参考图,编码为独立 Token 贯穿生成全程,维持角色、移动物体的身份与外观一致性。
通过动态物体检测、分割与深度判断,系统会自动区分静止与运动物体,运动的主体不会被写入 Patch Memory,从根源上避免了重影、错位等长时序记忆污染问题。
昆仑万维构建了三条自动化数据生产管线,形成了支撑世界模型迭代的 「无限数据引擎」:
配合自动化的相机位姿与米制深度标注、视频 Prompt 自动标注,以及 Scene-Quality 多维度数据质量评估系统,整套数据基建实现了从数据发现、处理到质量筛选的闭环,解决了世界模型训练数据成本高、标注难、规模不足的行业痛点。
在工程化落地层面,Matrix-Game 3.5 通过系统级优化,实现了小参数模型的高性能实时运行:其仅 5B 参数量的模型,可在单张 GPU 上实现 720P 分辨率下约 20FPS 的实时流式生成。
纵观本届 WAIC 的世界模型相关发布,多数方案要么是闭源的研究级产品,要么是垂直场景的定制化方案,而 Matrix-Game 3.5 走出了一条「开源普惠 + 通用基座」的差异化路线。
- Matrix-Game 3.5 开源地址:https://github.com/Riemann-Dynamics/Matrix-Game-3.5
开源促进了前沿技术的发展。此前,DiT 作者、纽约大学助理教授谢赛宁团队基于 Matrix-Game 2.0 的开源底座,发布了全球首个多人视频世界模型 Solaris,也从学术圈的实际使用上印证了这套开源方案的基础模型价值。英伟达和浙大联合发布的工作 Light Interaction 基于 Matrix-Game 3.0 模型进行研发。另外,英伟达的 SANA-WM 和 Adobe 的 RELIC 等国际头部大厂世界模型工作均将 Matrix-Game 相关模型作为对比基准。
学术圈的认可印证了这套开源方案的价值。
在应用端,Matrix-Game 系列也为各产业提供了一套可直接复用的世界模型基础能力:游戏厂商可以基于它快速生成可交互的游戏世界与场景内容;数字孪生与虚拟仿真领域可以用它构建实时动态的虚拟场景;具身智能企业则可以将其作为机器人的仿真训练环境,加速策略迭代。
更重要的是,作为昆仑万维全模态矩阵的技术基座,Matrix-Game 3.5 所构建的世界认知能力,正在向上向下延伸。这种统一基座带来的技术协同效应,是全模态布局的核心优势所在。
Mureka V9.5+O3,当 AI 音乐拥有「反思能力」
AI 音乐的尴尬其实和 AI 视频、机器人本质上类似:它能生成旋律,却不懂音乐的情绪逻辑,能堆出满编配,却不知道何时该留白。听起来什么都有,就是少了「人味」。
今年 4 月刚在全球权威评测中拿下冠军的 Mureka 系列这次带来了 V9.5 与 O3 版本,让 AI 能像人类创作者一样理解音乐的情绪、结构与审美逻辑。
这一次,昆仑万维决定主动克制编配密度,在真实音乐的框架内打磨细节,最终形成了更有人味的鲜明特质。
这种改进建立在 MusiCoT(音乐思维链)的系统能力上,其核心是让模型在生成音频前先形成完整的音乐思维,从全曲结构到局部表达逐层推进。V9.5 模型进一步将真实音乐的创作逻辑注入这套思维体系:编配不必时刻拉满,声部需要呼吸空间,情绪推进要有起承转合,所有的声音选择都服务于最初的创作意图,而非为了炫技而堆叠。
昆仑万维用 100 首同口径评测数据印证了这一审美转向的实际效果:其人声表现良品率达到 61.0%,较前代提升 8%,自然度和表达都更接近真人演唱;指令遵循上,Prompt 控制良品率达 97.0%,曲风完全体现比例达 95.7%;最后,音质类良品率均值 35.0%、综合可用率 28.0%,在克制编配的前提下依然取得了同轮最优,真实感并没有以牺牲稳定性为代价。
值得注意的是,V9.5 在音乐性均值上并非同轮最高,这种主动取舍跳出了「AI 音乐比谁更热闹」的竞争,开始向专业创作的审美标准靠拢。
O3 模型则更进一步,通过 test-time scaling 技术为 AI 音乐注入了反思能力,能像人类创作者一样边创作边审视,发现偏差就及时修正。
从技术逻辑上看,O3 建立在 V9.5 的真实感底座之上,通过推理阶段的算力扩展,延伸了 MusiCoT 的思维链条:在生成过程中,模型会持续围绕最初的全曲目标,反复审视当前的局部表达,一旦发现偏差,模型就会对后续的生成决策进行校准,让作品逐步向更完整、更自洽的方向收敛。
在引入 test-time scaling 后,O3 使 AI 生成音乐的听感良品率从 35% 提升至 43%,人声表现良品率从 60% 提升至 68%,综合可用率也从 35% 提升到 39%,证明了「音乐思维链 + 推理扩展」的组合具备持续提升作品质量的空间,也为 AI 音乐的后续升级指明了方向。
在昆仑万维的活动中,知名演员黄晓明也发表了对于 Mureka 的看法,他表示:「今天早上还让它生成了两首歌,很不错。因为很喜欢杨宗纬的风格,就让他照着空白格生成了一首抒情歌曲……也让它生成了一首中年危机的歌。还不错,词还挺触动人心的。」
一线艺人对于 Mureka 的主动试用并公开认可,代表了文娱产业从业者对国产 AI 音乐模型的接纳。
在音乐创作方面不断深耕的 Mureka 正在向专业创作的标准靠拢:当 AI 音乐摆脱了玩具感,真正具备专业创作潜力时,它对影视、音乐、游戏等内容产业的重构才算得上正式开始。
结语
站在 2026 年 WAIC 的节点回望,这一年大概率会被标记为世界模型发展的分水岭。
这也是昆仑万维 AI 战略迭代的一个关键节点。基于率先定义「世界模型元年」的思考,其推出打通数字与物理世界的统一认知底座,正在推动 AI 产业的演进节奏,提前布局下一代 AI 主战场。
或许,当 AI 能在数字世界生成时空自洽的开放场景,能在创作领域理解情绪与结构的审美,能在物理世界完成泛化的复杂操作,属于世界模型的时代就真的开始了。
这场由世界模型驱动的多模态范式跃迁,最终可能会像曾经的移动互联网、最近的大语言模型一样,彻底地渗透进内容、文娱、工业、生活的每一处角落。
我们刚刚见证的,只是这场变革的第一幕。
热门跟贴