打开网易新闻 查看精彩图片

2026 年 3 月,Yann LeCun 等人提出 LeWorldModel(LeWM)。它采用联合嵌入预测架构(JEPA),从原始像素中学习环境动力学,并通过高斯分布正则抑制表示坍塌,使端到端世界模型可以使用更为简洁的目标稳定训练。

然而,西安交通大学研究团队发现,即使施加了高斯正则,模型学习到的潜变量分布仍可能呈现明显的重尾现象,即少量潜变量远离主体分布,形成极端表示。

进一步分析表明,LeWM 使用的 Epps–Pulley(EP)正态性目标存在一个容易被忽略的「尾部盲区」:它能够判断整体分布是否偏离高斯,却难以持续纠正少量已经远离主体分布的极端潜变量。对于这类样本,EP 目标产生的校正梯度会迅速减弱,使其在训练过程中难以被有效拉回。这些远离主体分布的重尾样本落入训练数据稀疏的潜空间区域后,模型难以从中学习可靠的场景特征表征,进而影响后续的动力学预测与规划。

针对这一问题,研究团队提出了 QQWorld:用 quantile–quantile matching,也就是分位数 — 分位数匹配,替换 LeWM 原有的 EP 正则。

它的核心思想非常直接:不再通过核函数间接衡量两种分布的差异,而是对潜变量的随机投影进行排序,让每个样本直接向其次序对应的标准高斯分位点移动。

换句话说,模型不再只问「当前潜变量整体分布与高斯分布有多大差异」?而是进一步回答「每个样本应该移动到哪个位置」?

这种直接的分位点匹配机制能够在分布尾部持续提供有效梯度,从而更好地抑制极端潜变量并改善潜空间结构。

实验显示,在 Two-Room、Reacher、PushT 和 OGBench-Cube 四个控制环境中,QQWorld 将平均规划成功率从 79.75% 提升至 85.08%,增加 5.33 个百分点。与此同时,该方法实现极为简洁,核心代码不足 10 行。

此外,论文提出了 Cross-Batch QQ,通过引入少量历史批次的投影特征,辅助当前批次计算更加稳定的样本次序。历史特征仅用于排序,并不参与反向传播,因此几乎不会增加额外的训练显存开销。

实验表明,即使将物理训练批次缩小至原来的四分之一、显存占用降低约 73%,Cross-Batch QQ 仍能使模型的平均规划成功率显著超过 LeWM。该结果表明,QQWorld 不仅能够改善潜变量分布和规划性能,也为更大规模世界模型的高效训练提供了一种简单而可扩展的方案。

打开网易新闻 查看精彩图片

  • 论文标题:QQWorld: Quantile–Quantile Matching for World Model Regularization
  • 作者:Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu
  • 单位:西安交通大学
  • 论文链接:https://arxiv.org/abs/2607.28415

为什么 EP 正则难以控制尾部?

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

随后,LeWM 通过 Epps–Pulley(EP)正态性目标,约束这些投影样本接近标准高斯分布。论文指出,EP 目标可以等价理解为经验分布与标准高斯分布之间的 MMD,该 MMD 采用高斯核:

打开网易新闻 查看精彩图片

问题也恰恰出在高斯核有限的作用范围上。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

这一梯度在尾部迅速趋近于零。也就是说,当样本已经进入较远的尾部时,EP 正则几乎无法再为其提供有效的回拉信号。它可以衡量整体分布与高斯分布之间的差异,却难以持续纠正极端样本。

QQWorld 的做法:直接匹配高斯分位点

QQWorld 不再通过局部核相似度间接比较分布,而是将每个投影样本直接匹配到相应的标准高斯分位点。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

随后,模型根据样本次序计算相应的标准高斯目标分位点:

打开网易新闻 查看精彩图片

QQWorld 最小化排序样本与对应高斯分位点之间的平方距离:

打开网易新闻 查看精彩图片

因此,每个投影样本都有一个由其次序决定的目标位置。样本偏离对应高斯分位点越远,获得的纠偏信号就越强,从而能够更有效地抑制潜变量分布中的重尾。

论文还证明了二者之间的单向控制关系:当 QQ 损失趋近于零时,EP 差异也会趋近于零;反过来,EP 差异却无法控制 QQ 损失,这再次说明 QQ 正则化的有效性。

Cross-Batch QQ:小批次也能稳定排序

QQ matching 依赖批次内的样本次序。批次越大,经验分位点的估计越稳定,但需要保存的中间激活也越多,显存成本随之上升。为缓解这一矛盾,论文提出 Cross-Batch QQ:使用一个先进先出的队列,保存最近若干次迭代产生的投影特征,再将当前批次与历史批次合并计算次序。

假设当前物理批次大小为 N,队列中保存了 K 个历史批次,则有效排序池扩大为:

打开网易新闻 查看精彩图片

历史特征会从计算图中分离,只参与次序估计;梯度仍然只通过当前批次传播。因此,Cross-Batch QQ 可以在不显著增加反向传播显存的情况下,获得接近大批次训练的分位点估计。

论文进一步从理论上揭示了 Cross-Batch QQ 的Bias-Variance Tradeoff:适度增加历史样本可以扩大排序池、降低经验分位点估计的方差;但当队列过长时,较早的历史特征可能无法准确反映当前不断变化的潜在分布,从而引入分布陈旧造成的估计偏差。

打开网易新闻 查看精彩图片

这一分析解释了为何适中的队列长度通常能够取得最佳效果,也为 Cross-Batch QQ 的实际配置提供了理论依据。

更好的特征表示,潜空间尾部改善

实验沿用统一的离线数据、训练设置和基于 CEM 的目标条件规划协议,在 Two-Room、Reacher、PushT 和 OGBench-Cube 四个环境上进行评测。

打开网易新闻 查看精彩图片

结果显示,QQWorld 在四个环境中均超过基线,平均规划成功率由 79.75% 提升至 85.08%。

此外,潜变量的分布也明显更加规整。与 LeWM 相比,QQWorld 的平均 QQ RMSE 从 0.157 降至 0.121;径向尾部概率从 0.315 降至 0.123,更接近标准高斯对应的 0.10。

打开网易新闻 查看精彩图片

进一步地,可以对潜变量进行可视化,使用线性探针从潜变量恢复智能体二维轨迹时,QQWorld 的测试集平均 RMSE 为 2.58,LeWM 基线为 6.01。

打开网易新闻 查看精彩图片

这说明QQWorld 不仅让潜变量在统计意义上「更像高斯」,也让其中的物理状态结构更加稳定、易于读取。

显存消融:4 倍更小批次保留大部分收益

当物理批次大小为 N=32,且只使用当前批次计算次序时,模型的平均成功率为 65.42%。

加入 1 个历史批次后,成功率提升至 80.67%; 加入 2 个历史批次后,进一步达到 83.50%,但 GPU 显存占用约为 3435 MB。相比之下,标准 QQWorld 在 (N=128) 时取得 85.08% 的平均成功率,显存占用约为 12747 MB。

也就是说,使用 N=32 和两个历史批次,可以用 4 倍更小的物理批次和约低 73% 的显存,取得只低 1.58 个百分点的成功率,同时仍然显著超过 LeWM 基线。

打开网易新闻 查看精彩图片

总结

QQWorld 针对 LeWorldModel 潜空间中的重尾问题,用分位数匹配替换尾部梯度容易消失的 EP 正则。它不再只衡量经验分布与高斯分布是否不同,而是让每个投影样本直接向其次序对应的高斯分位点移动,从而在分布尾部保留持续有效的纠偏梯度。

在四个控制环境中,QQWorld 将平均规划成功率从 79.75% 提升至 85.08%,同时获得了更薄的潜空间尾部和更准确的状态轨迹重建。Cross-Batch QQ 则通过历史样本扩充排序池,将分位点的估计精度与反向传播的显存占用解耦,为小批量训练提供了一种更具可扩展性的方案。

更深层意义:这项工作的核心启示并不只是一种作为改进的分布正则方法。

一个统计量能够判断两种分布不同,并不意味着它天然适合作为神经网络的训练目标。对于潜空间世界模型而言,真正重要的是:当异常值和重尾已经出现时,正则项能否继续提供足够强、方向明确的纠偏梯度。

EP 更擅长衡量整体分布差异,但有限带宽的高斯核对极端样本的惩罚会逐渐饱和;QQ matching 则将「分布接近」转化为逐样本的目标运输,让偏离越远的样本获得越强的回拉力。这可能意味着,世界模型潜空间正则需要从「判断分布是否正确」,进一步走向「有效的修正梯度」。

作者介绍

论文第一作者为西安交通大学硕士生喻周顺。通讯作者为西安交通大学数学与统计学院许翔宇教授和胡晓玉教授。许翔宇教授的研究方向涵盖世界模型、三维视觉与具身智能(个人主页:https://xuxy09.github.io/)