作者丨李晨阳
编辑丨陈淑瑜
近两年,能自己走路、自己带路的机器人正从实验室走向真实场景:医院的配送机器人按医嘱送药,仓库里的搬运机器人找货架,家里的扫拖机器人按指令去某个房间。它们靠的不是提前存好的地图,而是“看懂画面 + 听懂指令 + 自己决定下一步往哪走”——这正是视觉语言导航(VLN)要解决的问题。
这类系统藏着一个少被提起的前提:它完全相信自己的“眼睛”。摄像头拍到什么,它就当成事实去决策。
▎于是真正的痛点浮现了:
视觉是它最脆弱的入口。机器人的所有判断都建立在像素之上,可真实世界的光照变化、物体遮挡、甚至镜头上一点污渍,都可能让“同一段路”在它眼里变得不一样。
越聪明,越怕“看不见的偏差”。大模型加持的导航机器人推理更强,却也更依赖视觉输入;一旦输入被轻微扰动,小错会一步步放大成“走错整个楼层”。
更难的是“验伤”。真实部署的机器人是封闭产品,你拿不到它的内部参数和梯度,传统那种“拆开看脑子”的评测方式根本用不上——而我们恰恰最该知道:它在受干扰时到底有多不靠谱?
过去的研究大多盯着“怎么让机器人在干净环境里走得更准”,却很少有人问“它在被扰动时会不会崩”。这正是这篇论文要补的缺口:香港科技大学(广州)陈昶昊教授团队提出的 AdvNav,在不打开机器人、不依赖任何内部信息的前提下,仅靠观察它的行走行为,就系统性地证明了:当前视觉语言导航系统普遍存在一个看不见的视觉软肋。
他们提出了 AdvNav——首个面向视觉语言导航任务的黑盒行为引导对抗攻击框架。相关成果已被 ACM Multimedia 2026(ACM MM 2026)录用。
AdvNav无需访问模型参数或梯度,仅通过观察智能体的导航行为即可不断优化攻击扰动。框架设计了基于智能体行为的双粒度反馈机制,综合利用轨迹级性能、动作级奖励以及轨迹偏离信息,引导攻击过程持续寻找更具破坏性的扰动。同时,结合扰动强度自适应调整和遗传算法优化噪声结构,在有限查询预算下即可获得高效攻击效果。
在经典R2R数据集上,AdvNav针对Transformer架构的HAMT模型以及基于大语言模型的MapGPT模型,分别取得了49.70%、65.96%和87.30%的攻击成功率,充分揭示了当前视觉语言导航系统普遍存在的潜在视觉脆弱性。
论文标题:AdvNav: Behavior-Guided Black-Box Adversarial Attacks on Vision-Language Navigation
论文地址:https://arxiv.org/abs/2607.11063
01
针对视觉与语言导航任务的黑盒对抗攻击难点在哪?
传统图像分类中的黑盒攻击通常只需面对一次预测:输入一张图像,模型立即给出分类结果,攻击者便可以根据输出不断调整扰动。而视觉语言导航则完全不同。
首先,智能体需要同时理解视觉信息与语言指令,并结合历史导航过程进行连续决策,属于典型的多模态时序任务。其次,导航具有明显的长期依赖特性。某一步的错误决策未必意味着任务失败,智能体往往能够依靠后续推理重新回到正确轨迹,自我修正能力使攻击难度大幅增加。
此外,导航任务的最终反馈具有明显的延迟性。攻击者通常只有在整个导航结束后,才能知道此次攻击是否真正导致任务失败。这种稀疏且滞后的反馈,使传统黑盒优化方法难以发挥作用。
因此,如何仅依靠智能体外部行为,在没有梯度信息的情况下持续优化扰动,成为 VLN 黑盒攻击的核心难题。
02
AdvNav 框架介绍
针对上述问题,陈昶昊教授团队提出了AdvNav——首个面向视觉语言导航任务的黑盒行为引导对抗攻击框架。
它的核心思路非常“克制”:不碰模型内部,只在机器人“看到的图像”上叠加一点点精心设计的扰动,然后观察它怎么走,再根据走出来的结果反过来优化这层扰动。整个框架靠两样东西撑起来:
双粒度反馈机制:从机器人的行为里提取“它有多偏离”的信号,代替白盒攻击里才有的梯度信息,指引攻击方向;
自适应扰动优化 + 遗传算法:在有限的“提问次数”(查询预算)内,把扰动的强度和形态调到最有效。
▎基于智能体行为的双粒度反馈指导
为在黑盒设定下提供替代白盒设定下梯度信息的有效攻击优化指导,AdvNav设计了一种从智能体输出行为中提取出的双粒度反馈作为优化目标,该反馈包括:
1.轨迹级表现得分:利用标准VLN评估指标路径加权成功率(Success weighted by Path Length,SPL)和导航误差(Navigation Error,NE)构建联合轨迹级攻击表现得分:
其中用于对齐SPL和NE的尺度,表示扰动条件和干净条件下对应度量的差异。最大化会促使智能逐渐偏离目标位置(NE 更高),并降低其轨迹效率(SPL 更低),这表明导航受到更严重的干扰,因此符合攻击目标。
2.动作级奖励得分:由于环境和指令构建时的限制,仅凭借标准VLN评估指标有些时候是稀疏的,无法提供有效的噪声优化指导,因此引入累计动作奖励得分:
以量化扰动在每一个时间步上对智能体选择正确动作能力的影响。其中,表示选择参考动作的可能性,表示选择最可能的错误动作的可能性。对所有时间步进行聚合符合 VLN 的时序依赖性,即每个决策都可能影响后续选择,从而累积形成长期行为漂移。
3.双粒度聚合反馈集:将上述信号整合为一个统一的攻击反馈集,用于第轮的每个候选扰动,如下所示:
具体来说,对于每个候选单轮扰动参数,我们生成对应候选单轮扰动,更新上一轮的累计扰动以形成本轮的候选累计扰动,并在此扰动下评估智能体。表示轨迹层面的扰动,表示动作层面的漂移,而则表示智能体是否实际偏离了参考轨迹。
▎自适应扰动优化
初始化并维护一个累积扰动,并在每一轮中执行以下操作:
1.候选累计扰动生成:通过将从噪声群体衍生出的扰动作为候选单轮扰动以固定的步长和累积符号叠加到当前累计扰动上,生成新的候选累计扰动;
2.攻击效果评估:根据智能体在每个候选累计扰动下的轨迹和动作,得到该扰动的双粒度聚合反馈集,进一步计算相对攻击收益作为所有候选扰动的评估标准。相对攻击收益是指如果该候选累计扰动造成了实际轨迹偏离,则为该候选累计扰动的轨迹级表现得分与上一轮累计扰动的轨迹级表现得分之差,如果没有,则为两者动作级奖励得分之差;
3.扰动更新:对所有候选累计扰动的相对攻击收益进行排序,过滤掉收益为负的候选,并优先造成实际轨迹偏离的候选。如果最佳候选累计扰动有效,则将其更新为最新的累计扰动;如果无效,则保留上一轮的累计扰动并改变累计符号,然后进行噪声群体遗传进化。
03
实验结果
论文从定量实验、消融实验和可视化结果三个方面验证了提出的 AdvNav 框架的有效性,AdvNav 在攻击效果和自然程度上都展现出了明显优势。
▎攻击效果远远超过基线方法
论文展示了在 R2R 数据集上对基于 Transformer 的 HAMT 模型和基于 LLM 的 MapGPT 模型的定量实验结果。对于 HAMT 的攻击效果,AdvNav 在 11 个场景上平均攻击率达到了 49.7%,特定场景攻击率可以达到最高 100%,伴随着导航效率的大幅下降和最终误差的稳定上涨,说明 AdvNav 在各种场景布局和指令下均展现出稳定的黑盒攻击性能,无需任何特定的前提条件。
对于 MapGPT 的攻击效果,论文采用了开源模型 Qwen3-VL 和闭源模型 GPT-4V 作为骨干网络,AdvNav 分别达到了 65.96% 和 87.30% 的攻击成功率。AdvNav 在 HAMT 和 MapGPT 上均表现出的强大攻击性能,凸显了其有效性和广泛的适用性,表明 AdvNav 可以作为通用的压力测试框架,有效识别视觉漏洞,而无需考虑 VLN 智能体的底层视觉感知和决策范式。
▎AdvNav 核心组件作用验证
论文对提出的 AdvNav 框架中的扰动强度更新、结构进化和双粒度反馈进行了消融实验。在随机扰动下,攻击成功率仅 23.40%,移除双粒度反馈中的动作级奖励得分和轨迹级表现得分后,攻击成功率分别下降 17.02% 和 2.13%,移除扰动结构进化和强度更新,攻击成功率分别下降至 38.30% 和 26.60%。这表明结合强度更新和结构进化,并使用双粒度反馈进行优化引导对于实现有效、稳定的对抗攻击影响至关重要。
▎可视化结果
论文引入了学习感知图像块相似度(Learned Perceptual Image Patch Similarity,LPIPS)来衡量扰动图像与原始图像之间的感知距离,该值越接近于零,表明扰动越难以察觉,视觉上与原始图像越相似。与其他扰动相比,AdvNav 获得了显著更低的 LPIPS 值,这表明其在保持强大攻击效力的同时,也具有良好的感知隐蔽性。AdvNav 优化得到的扰动形成了一个低频相干亮度场,类似于镜头上的雾霾或灰尘,降低了结构线索的对比度,并且难以被标准预处理抑制,从而导致导航行为出现持续偏差。
04
结语
AdvNav 替整个行业做了一件没人愿意直视的事:把具身导航那个藏在视觉里的软肋,摆到了台面上。
我们正把"带路"越来越多地交给机器人,可一旦它们"信了自己的眼睛"又看不见干扰,风险就藏在每一次配送、每一趟搬运里。AdvNav 的价值,正在于用一种现实里做得到的黑盒方式(只看行为、不碰内部),提前把这种脆弱性量化出来——它是一把安全标尺:上岗前先"考一考",避免带病部署;它揭示的"低频扰动难以被抑制"现象,也反过来指引我们设计更抗干扰的模型。
一句话总结:让机器人走得更远的,不只是更强的眼睛,还有提前知道"眼睛可能被蒙住"的清醒。AdvNav 做的,正是帮我们在机器人真正上路前,先看清那层看不见的雾。
除了能够作为评估视觉语言导航系统安全性的攻击方法和压力测试工具外,AdvNav还为具身智能的鲁棒性研究提供了新的技术路线。未来,该框架有望进一步应用于对抗训练、鲁棒导航模型设计以及具身智能安全评测等方向,为构建更加安全、可靠的开放世界导航系统提供技术支撑。
05
作者与机构
李晨阳:香港科技大学(广州)研究助理,现新加坡国立大学研究助理;主要研究方向为人工智能安全,致力于构建可信赖且可解释的物理人工智能和生成式人工智能。
李凯歌:中山大学网络空间安全学院研究员/博士后;主要研究方向为计算机视觉、多模态大模型、人工智能内容安全。
江泽宇:香港科技大学(广州)博士生;主要研究方向为高效的空间物理智能体,专注于将通用空间智能注入现实开放环境的具身应用场景。
陈昶昊(通讯作者):香港科技大学(广州)智能交通学域与人工智能学域助理教授、博士生导师,兼任香港科技大学跨学科学部助理教授;从事具身智能感知、导航与交互研究,组建 PEAK-Lab 课题组并担任独立 PI。
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
热门跟贴