把搜索从“必须”变成“可选”:浙大&清华联合RoboParty Lab提出INTACT,LeCun点赞,3w浏览量引爆X!

导语

发布一天,X上浏览量突破3万图灵奖得主Yann LeCun亲自点赞—— 这是INTACT在社交媒体上交出的成绩单。

世界模型学会了预测"动作会带来什么变化",但要从"想要的变化"倒推出"该做什么动作",传统方案只能靠大规模候选采样加成本函数评估——一次推理就要遍历数千条候选轨迹,耗时 1.5 秒以上。

浙大CAD&CG国家重点实验室、清华大学智能产业研究院(AIR)、RoboParty Lab(萝卜派对)、InSpatio(影溯)共同发布了INTACT,端到端训练一个“意图→动作”的直接映射接口,将推理延迟从1.48秒压到2.9-5.5毫秒,加速约300倍。在四个官方LeWM基准任务上,仅训练1个epoch、零搜索,直接控制器就达到**95.33%**的宏平均成功率。更值得关注的是,论文用一整节因果分析拆解了“为什么行”——这是近年世界模型方向罕见的研究深度。

硬核科普:三个关键概念 JEPA(联合嵌入预测架构)
打开网易新闻 查看精彩图片
硬核科普:三个关键概念 JEPA(联合嵌入预测架构)

一句话定义:在潜在空间中预测未来状态,而不是在像素空间中生成未来帧。

类比说明:就像你不需要完整想象下一个画面,只需要在心里有一个"大概是什么样"的向量——距离多远、方向在哪、什么东西在附近。

机器人场景:JEPA 让世界模型避免了在像素空间做生成式重建的昂贵代价,只保留对控制有用的几何和语义信息。

CEM(交叉熵方法 / 模型预测路径积分 MPPI)

一句话定义:一种基于采样的规划方法:随机生成大量候选动作序列,用世界模型推演结果,选择代价最低的那个。

类比说明:就像你打台球时,在脑子里快速试几十种出杆角度,选出最可能进洞的那个。

机器人场景:CEM 是 LeWM 等前沿世界模型的标配控制器,但每次决策都要采样 300×30=9000 条候选序列,推理成本极高。

Action Chunk(动作分块)

一句话定义:一次性预测未来 5 步动作序列,而不是单步预测。

类比说明:就像你写一个英文单词时不会逐字母思考,而是自然地写出整个词。

机器人场景:Action Chunk 让控制更流畅,避免逐帧推理的抖动,也是 INTACT 发挥优势的基础设计。

核心突破:INTACT 深度拆解 痛点:前向世界模型的控制不对称

LeCun 提出的 JEPA 范式在机器人领域催生了 LeWM、Fast-LeWM 等世界模型方法——它们能学会"给定当前状态 z_t 和动作 a_t,预测下一个状态 z_{t+1}"。问题出在控制端:

训练时_:动作参与塑造潜在空间结构
_部署时:要从通用高斯分布中重新采样、重新搜索

这意味着,即使世界模型本身已经学到了很好的表征,控制时还是要在 9000 条候选序列里用 CEM 做盲搜。表征越好,搜索成本反而越显得"冤枉"。

打开网易新闻 查看精彩图片

图 1 说明:论文图 1 展示了共享编码器 INTACT 的训练与循环控制架构。注意"本地调用"(local)与"目标调用"(goal)以完全相同语法进入同一个 Predictor,但梯度路由不对称——这是全篇最核心的设计。

方案:同构的双调用架构

INTACT 的核心洞察是:带动作标签的轨迹本身就包含了"从状态 A 到状态 B 该做什么动作"的监督。关键在于把两类意图统一起来:

两类意图,一个条件动作算子

意图类型

公式

角色

物理后继意图

m_local = z_{t+1} - z_t

真实物理变化,提供梯度锚定

可部署目标意图

m_goal =sg(z_g) - z_t

模拟部署条件,但梯度只流向当前状态

两者共享一个四槽输入语法

h_t(m) = [z_t;  m;  z_t ⊙ m;  A(a_{t-1})]

四个槽分别是:

当前状态z_t:告诉我"我在哪"

意图向量m:告诉我"想去哪"

状态-意图交互项z_t ⊙ m:提供廉价的 bilinear 交互,让同一位移在不同姿态/接触条件下被不同解读

前序动作编码A(a_{t-1}):保留时序上下文

打开网易新闻 查看精彩图片

图 2 说明:论文图 2 直观对比了两种范式——LeWM 从无信息高斯分布撒出 300×30 个候选序列,再用成本函数排序;INTACT 直接从目标位移均值生成行动计划,无需任何候选评估。

三个损失项,一种新范式

INTACT 的训练目标只有三项:

L_world:标准的 JEPA 潜在预测 + SIGReg 正则化,维持世界模型能力

L_z+:基于物理后继的逆动力学负对数似然,告诉模型"真实发生了什么样的变化→对应了什么动作"

L_goal:基于目标意图的 GCSL 式负对数似然,告诉模型"如果部署时给出一个目标变化→该输出什么动作"

梯度设计是关键:物理后继给双向梯度(锚定表征),目标意图只给单向梯度(模拟部署时不提供未来信息)。这种不对称性让模型学会了"可部署的意图坐标",同时不会把目标意图强行拉到与物理后继一致的位置——因为部署时你永远没有"真实的下一步"。

分布式动作法则:Direct 模式

部署时,INTACT 有两种模式:

Direct(主模式):直接用动作法则的条件均值输出 action chunk,零搜索、零候选评估,2.9-5.5ms 完成推理

Guarded A(可选验证):在 Direct 计划周围做小范围局部 CEM(128×3=384 候选),仅用 1/23 的候选量进一步提升成功率

打开网易新闻 查看精彩图片

图 3 说明:论文图 3 展示了在 PushT 任务上,物理逆动力学监督(L_z+)对 Actor-disabled CEM 和 Frozen Probe 的改善效果。这张图证明了"表征受益"是可分离测量的——即使最终控制器不用 INTACT,物理逆监督本身也在改进潜在空间。

效果:四个任务上的碾压级表现 单任务:1 epoch 训练,零搜索直接控

任务

Direct(0候选)

Guarded A(384候选)

LeWM 官方

PushT

85.78%

92.22%

96.0%

OGBench Cube

100.00%

99.78%

74.0%

DMC Reacher

97.67%

97.44%

86.0%

TwoRoom

97.89%

98.00%

87.0%

宏平均

95.33%

96.86%

85.75%

注:LeWM 官方数字来自已发布论文,使用纯 CEM 搜索(300×30=9000 候选)。INTACT Direct 零搜索即超其 9.58 个百分点。

多任务共享编码器:一个视觉骨干驱动四个域

方法

PushT

Cube

Reacher

TwoRoom

宏平均

LeWM CEM

74.6%

7.38%

83.1%

39.7%

66.18%

INTACT Direct

80.2%

99.6%

95.7%

82.1%

89.39%

INTACT Guarded A

85.0%

99.0%

97.9%

80.0%

90.48%

在共享编码器下,INTACT Direct 比同配置 LeWM CEM 高出23.22 个百分点。尤其是在 Cube 任务上,LeWM CEM 仅 7.38%,INTACT 达到 99.6%——这是因为 Cube 的接触动力学高度非线性,CEM 的高斯采样很难覆盖有效动作区域,而 INTACT 的意图坐标直接指向可行解。

打开网易新闻 查看精彩图片

图 4 说明:论文图 4 展示了共享编码器下各训练单元的逐任务成功率对比。从仅物理逆动力学到仅目标意图再到 Full INTACT,成功率阶梯式上升,每一项消融都在证明两个意图家族缺一不可。

为什么行?一篇罕见的因果分析

INTACT 论文最特别的地方,是用了整整一个实验章节做因果机制分析,而不是停留在"我们分最高":

1. 动作族诊断指标:关系比精度更重要

论文提出了预测动作与专家动作之间的 CKA(线性中心核对齐)和 kNN 重叠度作为诊断指标。在 45 个检查点的跨 epoch 分析中:

预测-专家kNN 对齐度与 Direct SR 的 Pearson 相关系数:r = 0.954

线性CKA相关:r = 0.897

逐点动作:仅 r = 0.815

这意味着:保持动作之间的关系结构比精确复现每一个动作值更重要。这也解释了为什么 INTACT 的条件均值策略有效——它保留的是"动作流形"而非"动作点"。

2. 高秩 ≠ 好表征

有效秩(effective rank)更高的模型,不一定有更高的成功率。论文给出了具体反例:两个模型秩分别为 93.87 和 89.26,但前者 SR 只有 74.22%,后者达到 89.39%。秩是必要检查但不是充分证书

3. 坐标映射干预实验

这是全篇最漂亮的实验之一:论文在共享编码器下做跨任务坐标映射——

正确配对(PushT→PushT 映射):恢复 68.04% SR

随机打乱配对:仅 9.46%

逆向互换(用 LeWM 的 actor 替换 INTACT 的 predictor):仅 5.08%

结论很清楚:INTACT 的意图坐标确实编码了可迁移的动作语义,但这种语义是任务局部的,不能跨任务直接复用

打开网易新闻 查看精彩图片

图 5 说明:论文图 5 展示了任务纯度、动作 R²、CKA、kNN 对齐度与成功率的关系。kNN 对齐度的 r=0.954 近乎完美地追踪了 Direct 控制能力,而逐点 R² 明显弱很多。这张图是整个"动作家族理论"的实证基石。

技术溯源与关联工作 团队脉络

INTACT 来自浙江大学 CAD&CG 国家重点实验室(Junhan Sun、Guofeng Zhang)与清华大学智能产业研究院 AIR / RoboParty Lab(Hao Zhao)的联合团队。通讯作者 Hao Zhao 和 Guofeng Zhang 分别是 RoboParty Lab 和 InSpatio 的核心成员。

从技术路线上看,INTACT 承接了 LeCun 提出的JEPA(联合嵌入预测架构)范式,直接对话的是LeWM(Learning Environment World Models)系列工作。与 C-JEPA、PRISM、Qantara 等方法的关键区别在于:INTACT 不是改进世界模型本身,而是在世界模型之上叠加了一个可部署的意图-动作接口,将"学习预测"升级为"学习如何行动"。

局限性与边界

论文第 6 节坦诚列出了多项局限:

当前仅在 4 个仿真任务、固定图像目标、离线专家演示上验证

动作商空间仅限于演示支撑集,未验证对 OOD 目标的泛化

高斯均值控制在多模态动作分布处可能落在两个有效模式之间

未在真实机器人、跨具身场景测试

但这些问题更多是"还没做"而非"做不到"——INTACT 的框架本身是任务无关和具身无关的。

资源直达

论文:arXiv:2607.26056

项目主页:zju3dv.github.io/INTACT-JEPA

GitHub:github.com/zju3dv/INTACT-JEPA

RoboParty Lablab.roboparty.com

InSpatio:inspatio.com

欢迎有兴趣的朋友加入群聊 ,后续多多交流学习

打开网易新闻 查看精彩图片

Mbot具身智能实验室

让尖端科技触手可及,人人皆可探索未来

打开网易新闻 查看精彩图片

Mbot基础交流群等你加入,下方扫码联系

具身-杰西

Mbot具身-小助手

Mbot-视频号

Mbot-公众号