2026WRC第二日,星源智再传喜讯——继具身交互世界模型ω-EVA后,公司发布World Model最新研究成果——JEPA-WAM。该模型由星源智联合创始人、算法负责人何嘉伟博士与星源智实习生林艺涵主导研发,针对现有机器人视觉语言动作模型泛化性不足、视频生成式世界动作模型部署成本高,以及latent世界模型中世界建模与动作生成监督割裂等问题,提出全新的latent世界建模方案。

JEPA-WAM以小模型参数量,无需大规模机器人预训练数据和像素级未来视频生成,通过学习环境时序变化规律,并将世界建模与动作生成进一步打通,在较低算力和数据成本下提升机器人策略的环境泛化能力。

从此前发布的具身交互世界模型ω-EVA到JEPA-WAM,星源智正在围绕一个核心方向持续推进World Model研究:世界模型不只是预测未来,更要理解行动与环境变化之间的关系,并最终服务于机器人的动作决策。

从“预测画面”到“理解变化”:重构机器人世界建模逻辑

从“预测画面”到“理解变化”:重构机器人世界建模逻辑

真实世界始终处于变化之中。相机视角、光照、场景布局以及物体位置都可能发生改变,仅学习“观测—动作”关联,很难支撑机器人面对真实环境中的分布偏移。

传统VLA主要学习“观测—动作”关联,对环境动态变化缺乏建模;视频生成式WAM通过预测未来视频理解环境变化,但推理成本较高;现有latent WAM则存在未来表征压缩失真,以及世界建模与动作生成监督脱节等问题。

图:JEPA-WAM的概述与性能表现
打开网易新闻 查看精彩图片
图:JEPA-WAM的概述与性能表现

针对这些问题,JEPA-WAM不再以生成一幅确定的未来画面为目标,而是转向学习跨任务通用的环境时序变化规律。模型基于冻结的预训练V-JEPA编码器,构建当前—未来联合结构化表征目标,不压缩细粒度空间信息,完整保留patch-level空间对应关系,对场景局部区域变化、物体位置迁移、空间关系重构等动态特征进行建模,让模型理解“环境如何发生变化”,而非机械记忆“固定未来画面”。

这一变化也指向机器人World Model更核心的价值:相比生成一个视觉上完整的未来,机器人更需要获得能够帮助其判断和行动的环境动态信息。

首创共享预测器架构,让“理解世界”直接服务“如何行动”

首创共享预测器架构,让“理解世界”直接服务“如何行动”

理解环境如何变化之后,更关键的问题是,如何让这种理解真正作用于机器人行动。

JEPA-WAM首创Shared Predictor(共享预测器)双任务协同架构,由同一预测器同时承担latent状态时序预测与连续动作生成两项任务,将环境动态变化的监督信号直接反向优化动作生成主干网络,让策略网络主动适配环境动态特性。与此同时,模型通过独立的动作读取分支,规避时序预测与动作预测任务之间的相互干扰,在兼顾世界建模有效性的同时保持动作生成精度。部署过程中无需生成未来视频帧,也进一步降低了视频生成式世界模型带来的推理成本。

图:JEPA-WAM共享预测器将状态转移预测与动作生成相结合
打开网易新闻 查看精彩图片
图:JEPA-WAM共享预测器将状态转移预测与动作生成相结合

JEPA-WAM的时序过渡监督方案还具备通用适配能力。在不改变原有模型感知、动作生成核心通路的情况下,通过新增轻量级未来Token、对齐V-JEPA联合表征目标,可以为已有预训练VLA补充环境动态先验,并可适配π0.5等预训练VLA策略。这意味着,World Model不仅可以作为一套独立模型存在,还可以成为一种可迁移的通用辅助监督范式,进入已有机器人策略体系。

与此同时,JEPA-WAM基座模型仅0.5B参数,无需大规模机器人预训练数据,也无需像素级未来视频生成,在性能、效率与部署成本之间寻求更适用于真实机器人系统的平衡。

目前,JEPA-WAM相关代码已正式开源。星源智希望通过开放研究成果,为World Model与机器人策略融合提供更多可复现、可验证的技术参考,推动latent世界建模在具身智能领域的进一步探索与应用。

从ω-EVA到JEPA-WAM,让World Model真正服务机器人行动

从ω-EVA到JEPA-WAM,让World Model真正服务机器人行动

JEPA-WAM并不是星源智在World Model方向的第一次探索。此前发布的ω-EVA具身交互世界模型,通过Envision–Verify–Act(预演—验证—执行)闭环,在机器人执行动作前预测候选动作对应的未来状态,并基于预测结果验证、优化动作,让世界模型进入机器人动作决策过程。

如果说ω-EVA关注的是“这么做,会发生什么”,让机器人利用未来预测更好地行动;那么JEPA-WAM关注的则是“世界是怎么变化的”,通过学习环境时序变化规律,让世界建模直接参与动作策略优化。

二者采用不同的建模路径,构成了星源智探索World Model的两种能力视角:一方面,让机器人能够预演行动可能带来的未来;另一方面,让机器人理解环境如何随时间和行动发生变化。二者最终指向同一个目标——让World Model从预测世界进一步走向服务机器人行动。