这项由新加坡国立大学与香港理工大学联合开展的研究,于2026年7月以预印本形式发布,论文编号为arXiv:2607.15207v1,分类为计算机学习领域。有兴趣深入了解的读者可通过该编号在arXiv平台查询完整论文。
一、一场关于机器人"梦境"与"行动"的安全危机
在机器人领域,有一类越来越受关注的新型系统,研究者们称之为"世界-行动模型"。普通的机器人控制系统,就像一个只会看地图然后走路的人——看到场景,然后输出动作,仅此而已。而世界-行动模型则更聪明,它不仅会做动作,还会在脑海里"预演"一遍未来:我接下来要抓这个杯子,那接下来的几帧画面应该是手臂伸出去、手指合拢、杯子离开桌面。这种"边想象边行动"的能力,让研究者们相信,机器人应该会因此变得更安全、更可靠——毕竟,如果机器人能预见到自己的行为后果,那危险的动作就能在执行前被发现和阻止。
然而,这项研究揭示了一个令人不安的盲点:上述这个"因为能想象所以更安全"的假设,其实站不住脚。
研究团队提出了一种名为BadWAM的攻击框架,专门针对这类"世界-行动模型"。他们发现,只需要对机器人摄像头捕捉到的画面施加极其微小的、肉眼几乎察觉不到的干扰,就能让机器人的"行动"和"想象"之间产生脱节——机器人脑海中预演的未来画面依然看起来合理正常,但它实际输出的动作指令,却已经悄悄偏向了失败的方向。
更让人头皮发麻的是,这就意味着:那些依赖"查看机器人的想象画面来判断行为是否安全"的安全监控机制,可能在此类攻击面前完全失效。机器人的"梦"还是好梦,但它的"手"已经被攻击者悄悄握住了。
二、机器人的"想象力"到底是什么
要理解这项研究,需要先搞清楚"世界-行动模型"究竟是如何运作的。
把普通的机器人策略比作一名厨师,他只有一本食谱(视觉输入)和做菜的手(动作输出):看到食材,然后直接切。而世界-行动模型这位厨师则更复杂:他看到食材之后,会先在脑子里过一遍"我切下去之后,这块肉会变成什么形状,汁水会怎么流动,盘子里最终会呈现什么画面"——然后才动刀。这个"脑子里过一遍"的过程,就是所谓的"世界预测"或"未来想象"。
从数学上描述这个过程:普通的机器人策略直接从当前观测和语言指令映射到动作序列,而世界-行动模型则先生成对未来世界状态的预测(可以是潜在状态,也可以是解码后的视频帧),再基于这个对未来的想象来产生行动指令。在一些模型中,未来状态和动作甚至是联合生成的,两者共享同一个表征空间。
近年来,这类模型发展迅猛。有些版本(如Fast-WAM)甚至发现:即使在实际部署时不做显式的未来生成,只要训练时用了视频预测作为辅助目标,模型的行动质量也会显著提升——这意味着"世界建模能力"的影响已经深深烙印在模型的参数里,不需要你看到它,它就在那里。还有一些更新的变体,如专注于可寻址物体操作的OA-WAM、统合移动与操作能力的ABot-M0.5,以及引入视觉-触觉预测的VT-WAM,都在把这套"想象再行动"的范式推向更复杂的场景。
研究者们普遍认为,这种未来想象能力可以构成一种天然的安全机制:只要让一个监控模块去检查机器人预演的未来是否合理,就能发现并阻止危险行为。然而,这里有一个致命的逻辑漏洞,正是BadWAM所揭示的核心问题——安全监控只能看到机器人"想"了什么,却无法保证机器人"想"的和"做"的是同一件事。
三、攻击者的切入口:一个被忽视的接缝
研究团队把这类新型攻击称为"世界-行动漂移攻击"(World-Action Drift Attack)。这个名字里的"漂移",准确地描述了攻击的本质:让机器人的行动,悄悄漂离它的想象。
攻击的形式非常克制:攻击者只能在机器人摄像头画面上叠加一层极小的视觉扰动,扰动的幅度被严格限制(使用无穷范数约束,即图像上每个像素点的变化不超过一个很小的阈值ε=0.06,在256色的像素尺度上大约只是约15个色阶的微小偏移),以至于人眼基本看不出来有任何异常。攻击者不能修改语言指令,不能改变机器人的状态,不能接触模型的参数,更不能直接干预执行后的动作。这是一种非常受限的攻击形式,却依然造成了惊人的破坏力。
BadWAM框架包含两种具体的攻击实例,对应两种不同的攻击策略,可以理解为攻击者的两种"姿态"。
第一种姿态叫做"纯行动攻击":攻击者只关心让机器人的动作输出偏离正常轨道,不在乎机器人的"想象"有没有被破坏。这是一种直接、高破坏力的攻击,目标就是让机器人任务失败,越快越好。
第二种姿态叫做"保想象攻击":攻击者除了让动作偏离,还特别要求保持机器人的未来预测画面接近正常状态。这是一种更隐蔽、更狡猾的攻击——安全监控系统看到的未来想象依然正常,但机器人实际执行的动作已经被篡改。这就像一名特工在改变了暗杀计划的同时,还把假情报发回总部,让总部以为一切都按计划进行。
这两种攻击都完全在"黑盒"条件下运行:攻击者不需要了解模型内部结构,只需要能查询模型输入输出即可。在"纯行动"场景下,攻击者只能看到输出的动作序列;在"想象可见"场景下,攻击者还能看到模型输出的预测未来画面(这对应于许多真实部署场景——未来预测画面会被提供给规划模块、调试系统或安全监控器使用)。
四、攻击是如何找到"最佳干扰"的
研究团队使用的优化方法,是一种不需要梯度、不需要模型参数的"零阶搜索"方法,更直白地说,就像在一个黑盒里盲目摸索最佳答案,但用了一种聪明的随机方向采样策略。
在每次机器人重新规划动作之前,攻击者都会对当前要发给模型的图像进行一轮快速优化。具体做法是:先查询一次干净的(未干扰的)图像得到参考输出,然后随机生成若干个扰动方向,分别在图像上施加"正向"和"负向"的微小偏移,把这两次结果都查询一遍,根据哪个方向让目标函数(动作偏离量,或者动作偏离量减去想象偏离量的加权值)更大,来更新扰动的方向。这样循环若干次,就找到了一个在当前攻击预算内最有效的扰动。默认设置是每次重规划做8轮这样的搜索,加上1次干净参考查询,共17次模型推理调用。
对于"保想象攻击",优化目标里多了一个惩罚项:如果预测的未来画面偏离了干净状态太多,这个惩罚就会把分数拉低,迫使攻击者找到那些"能让动作跑偏但又不破坏未来画面"的神奇扰动方向。权重参数λ控制着这个惩罚的强度:λ越大,未来画面保留得越完整,但动作偏离的空间也越小。当λ=0时,保想象攻击退化为纯行动攻击。
五、实验:数字告诉我们的故事
研究团队在两个机器人操作基准测试平台上对BadWAM进行了评估。一个是LIBERO平台,包含空间推理、物体操控、目标导向和长时序四个任务套件,每套有10个具体任务;另一个是RoboTwin平台,是一个更大规模的双臂机器人操作基准,涵盖更复杂的场景。评估指标是"闭环任务成功率"——也就是机器人在真实(模拟)环境中一步步执行动作、并接收环境反馈的条件下,最终完成任务的概率,这比只看单步动作预测的准确性更能反映真实能力。
研究者们评估了三种不同的世界-行动模型变体。"纯行动WAM"直接从观测到动作序列,不显式暴露未来预测;"联合WAM"同时预测未来视觉状态和动作;"IDM WAM"则先构建未来想象表征,再从中解码动作。
实验结果相当触目惊心。在清洁(无攻击)条件下,纯行动WAM在LIBERO上的成功率是96.5%,联合WAM是98.1%,IDM WAM是98.4%——三个模型都表现得非常好。但当BadWAM的"纯行动攻击"介入之后,纯行动WAM的成功率直接跌到43.1%,足足下降了53.4个百分点。联合WAM被攻击后降至61.5%,IDM WAM降至66.1%。"保想象攻击"的效果与纯行动攻击非常接近:联合WAM降至63.0%,IDM WAM降至68.1%——这意味着即使攻击者主动约束自己不破坏未来预测画面,攻击依然强力有效。
在RoboTwin平台上,效果相对温和一些,但仍然显著:三种模型的成功率从91%~92%的区间,分别下降了约6到8个百分点。
研究者们还做了两种对比实验来验证BadWAM并非只是"把图像搞乱了就行"。第一种是随机扰动基线:用同样大小的扰动,但是随机的、不针对模型输出优化的,结果联合WAM和IDM WAM的成功率分别只降到71.0%和75.2%,远不如BadWAM的效果。第二种是白盒攻击上界:允许攻击者直接对模型做反向传播、利用梯度来优化扰动,结果两个模型分别降到49.2%和52.8%——比BadWAM稍强,但强得有限。这说明BadWAM的黑盒查询攻击已经相当接近梯度访问条件下的攻击上界,同时远超随机破坏图像的效果,是真正有目标的攻击。
六、失败是如何发生的:渐进式漂移而非突然崩溃
理解这种攻击如何在闭环执行中造成失败,需要打破一个直觉:人们可能以为,被攻击的机器人会立刻做出明显错误的动作——比如手臂猛地往一边甩。但实际情况更像是一场慢动作的悲剧。
研究团队记录了典型的失败场景:被攻击的机器人一开始并不会立刻崩溃。它依然按照合理的逻辑开始任务,向正确的方向移动,试图抓取物体。但随着时间推进,它的每一个动作都带着一点点偏差,就像一名因为轻微眩晕而走路微微偏向的人——单步看起来还好,但走了几十步之后,已经离目标越来越远。在视频记录的一个LIBERO-10任务案例中,被攻击的机器人成功抓起了第一个物体,但放置时碰倒了旁边的东西,随后又在抓取第二个物体时屡屡失败,最终无法完成任务。
数据也印证了这种"渐进式漂移":研究者统计了每次重规划时干净动作和被攻击动作之间的距离,发现这个差距会随着执行步骤的增加而累积。最终失败的执行序列,其累积动作偏移量显著大于成功执行的序列。而相比之下,未来预测画面的偏移量,在成功和失败的序列中却高度重叠——这正是攻击隐蔽性的来源。如果你只盯着机器人的"想象"来判断它是否在正常工作,你会觉得一切都好,直到任务彻底失败。
研究者们还发现了一个有趣的结构性规律:扰动对动作的影响并不是均匀的。通过分析哪些动作通道受到了最大的干扰,可以看到连续型动作通道(如三维位置XYZ和旋转)受到的冲击远大于离散的夹爪开合命令。在时序上,动作序列的后半段("晚期"部分)受到的扰动往往大于前半段——攻击更倾向于破坏远期规划而非即时动作。这说明BadWAM并不是简单地在输出上加噪声,而是找到了与任务相关的结构性薄弱点。
七、保想象攻击:安全监控的盲区
现在回到那个核心问题:如果一个安全系统只看机器人的"想象画面"来判断行为是否正常,它能发现BadWAM的攻击吗?
答案是:通常发现不了。
研究者们在"保想象攻击"模式下,专门追踪了未来预测画面的偏移量。在40个LIBERO任务的测试中,保想象攻击能在其中39个任务上将预测未来画面的偏移量压得低于纯行动攻击,而两者造成的任务失败率却非常接近。换句话说,攻击者可以在不怎么改变"想象"的前提下,依然大幅破坏"行动"——两者的解耦是真实存在的,而不只是理论猜测。
调节λ参数的实验进一步揭示了这个权衡关系。当λ从0逐渐增大,未来预测画面的漂移量确实在减小,但任务成功率也相应地有所回升——直到λ过大时,攻击几乎被"保想象"的约束给勒死,失去了大部分杀伤力。在中等λ值(如0.015)下,可以找到一个甜蜜点:预测未来的偏移量明显下降,同时任务失败率依然很高。这就是攻击者的最佳隐蔽点:安全监控看到的未来预测还算正常,任务却已经注定失败。
研究者们用了一个解耦评分(动作偏移量与未来偏移量之比)来量化这种效果:攻击产生的动作偏移与未来偏移之间的比率在优化过程中是稳步上升的,说明查询优化器确实在找到那些"用最小的未来破坏换取最大的动作破坏"的扰动方向。
八、攻击能"传染"给不同的模型吗
一个自然的问题是:这些扰动是不是只针对特定模型?换一个不同架构的机器人,攻击还管用吗?
研究结果表明,BadWAM的扰动具有相当程度的跨模型迁移能力。研究者们尝试在一个模型上优化扰动,然后把这个扰动拿去攻击另一个不同架构的模型。结果显示,跨模型迁移的攻击依然有效:纯行动WAM→联合WAM的迁移使目标模型成功率降至64.2%(清洁状态为98.3%),联合WAM→IDM WAM的迁移使目标降至59.2%(清洁状态为100%),IDM WAM→联合WAM的迁移使目标降至61.7%。保想象攻击的迁移效果同样明显,两个方向的迁移分别造成约35到39个百分点的成功率下降。
这个结果的含义是:BadWAM找到的扰动并不只是某个特定模型的私密"软肋",而是指向了视觉观测空间中一些对行动生成普遍敏感的方向——不同架构的模型共享着这些脆弱点。
九、防御能管用吗:简单手段的局限
研究者们也测试了几种简单的防御手段,看看是否能抵御BadWAM。
对图像做高斯模糊处理(让图像变得稍微模糊,从而抹平细微的扰动纹理),效果相当不错:联合WAM和IDM WAM在被攻击后的成功率分别从57%和55%回升到85%和89%,同时清洁状态下的性能几乎没有损失。JPEG压缩加噪声的集成(对图像做JPEG压缩并加入随机噪声,然后平均多次预测结果)效果更好,被攻击成功率分别回升至89.2%和90%。相比之下,随机缩放裁剪的集成策略则完全不可用——它虽然也能弱化攻击,但同时把干净状态下的成功率也拉低到了约50%,等于是"杀敌一千自损八百"。
然而,研究者们明确指出:这些防御都是"非自适应防御"——攻击者在优化扰动时没有考虑这些防御的存在。如果攻击者知道防御手段并调整策略(比如对高斯模糊后的图像来优化扰动),这些防御的效果会大打折扣。
研究者们还测试了一种检测方法:对每次模型查询做增强一致性检测(比较原始图像和JPEG变换图像得到的输出是否一致,不一致则报警)。该检测方法的AUROC(曲线下面积,衡量分类器能力的指标,满分1.0)对联合WAM和IDM WAM分别达到0.675和0.725,说明有一定区分能力,但在5%误报率的实际约束下,它只能检测出13.4%和21.4%的攻击事件。这对于安全关键应用而言,基本是不可接受的低召回率——你无法靠它来可靠地发现攻击。
十、攻击在不同任务类型上的表现差异
BadWAM的攻击效果并非对所有任务都一视同仁,不同任务类型上表现出明显差异。
LIBERO的四个套件中,空间任务(要求精确的空间定位)和长时序任务受到的打击最为惨烈。纯行动WAM在空间任务上的成功率从96.5%暴跌至16%,在长时序任务上从92.5%跌至23.5%。相比之下,物体操作任务的抵抗力明显更强,即使是纯行动WAM被攻击后依然有93%的成功率。联合WAM和IDM WAM也呈现相同的规律,只是降幅相对温和。
这种差异背后有直观的逻辑:物体操作任务通常只需要大致正确地接近目标物体,中等程度的动作偏差在后续重规划时还有机会被纠正;而空间任务和长时序任务对动作精度的容忍度极低,早期一个微小的错误会随着时间累积放大,导致整条执行链条崩溃。攻击正是利用了这种"容错空间小"的特性。
研究者们还做了pass@k分析("k次尝试中至少成功一次"的比率),发现被攻击后的成功率在20次重复尝试中始终维持低位,没有出现"多试几次就能侥幸成功"的现象——说明BadWAM不是制造偶发故障,而是系统性地降低了模型能力。
十一、这一切对机器人安全意味着什么
归根结底,这项研究想传达的核心信息可以这样来理解:在机器人安全领域,长期存在一种隐含的乐观假设——如果你能看到机器人"预见"了一个合理的未来,那它的行动应该也是安全的。BadWAM用实验数据告诉我们,这个假设在面对专门设计的对抗性干扰时会失效。
问题不在于"想象力"这件事本身是坏的,而在于"行动"和"想象"这两条线并不总是绑定在一起的。它们来自同一个模型的不同输出通道,而这两个通道可以被有针对性地分开操控。攻击者可以找到一个扰动,让行动通道跑偏,同时让想象通道保持平静。从外部看,一切都显得正常,直到机器人搞砸了任务。
这意味着,评估机器人安全性不能只盯着"想象画面是否正常"这一个维度。真正需要检查的,是行动和想象之间的同步性——机器人做出的动作,是否真的和它预见到的未来相符?这是一个更难回答、但也更关键的问题。
研究者们指出,一个完善的WAM安全评估体系应当同时报告任务成功率、动作偏移距离、预测未来偏移距离、输入扰动的感知程度、动作序列的时序结构变化,以及跨任务类型的失败分布——而不是只看一个综合成功率数字。只有这样,才能区分"粗暴的动作劫持"和"隐蔽的想象保留型失败"这两种截然不同的危险。
说到底,这项研究做的事情,用一句话来概括就是:它率先发现并证明了一种新的机器人攻击面,并给出了系统性的攻击框架和诊断工具。研究者们不是要让人们放弃"世界-行动模型"这个方向——恰恰相反,他们认为这是未来机器人控制的重要路径,但正因如此,才需要更早、更严肃地面对它的安全弱点。
机器人系统越来越接近真实世界的使用场景,从工厂到家庭,从手术台到街道。当一个机器人"看起来在做正确的事情",人类监督者可能会放下戒心。而如果攻击者能在不惊动监控系统的情况下悄悄让机器人失控,后果可能远比任何数字更沉重。这正是BadWAM这个研究存在的价值:在问题变成灾难之前,把它搬到台面上来审视。
有兴趣深入了解这项研究每一个技术细节的读者,可以在arXiv平台上通过编号arXiv:2607.15207查阅完整论文。
Q&A
Q1:世界-行动模型(WAM)和普通机器人控制系统有什么区别?
A:普通机器人控制系统直接从摄像头画面输出动作指令,就像"看到什么就做什么"。世界-行动模型则额外具备"想象能力":在执行动作前,它会先在内部预演接下来几帧的画面——手臂怎么移动、物体会怎样变化,然后再基于这个预演来规划行动。这种"先想后做"的机制让WAM理论上更安全、更可靠,但BadWAM研究恰恰发现,这种"想象"和"行动"的联系在对抗性干扰下可以被拆散。
Q2:BadWAM攻击需要直接接触机器人或修改它的程序吗?
A:不需要。BadWAM只在机器人摄像头捕捉到的图像上叠加极小的视觉扰动,这种扰动小到人眼几乎看不出来(每个像素点的变化不超过约15个色阶)。攻击者不需要接触机器人硬件、不需要修改程序代码、不需要了解模型内部结构,只需要能影响到机器人看到的图像画面即可——比如在摄像头视野内的物体上贴上精心设计的图案。
Q3:高斯模糊等防御手段能彻底解决BadWAM的威胁吗?
A:目前不能。研究测试的高斯模糊和JPEG压缩防御方法确实能在一定程度上削弱BadWAM的攻击效果,让被攻击后的任务成功率从约57%回升至约85%~90%。但这些防御方法是"非自适应"的——攻击者一旦知道防御手段的存在并调整优化策略,这些防御的效果会大幅下降。此外,检测攻击的一致性检验方法在5%误报率下只能发现约13%~21%的攻击事件,对安全关键应用而言远远不够。
热门跟贴