近年来,能自己走路、自己认路的机器人正加速走进现实:医院的配送机器人按医嘱送药,仓库里的搬运机器人自主寻找货架,家里的扫拖机器人听从指令前往指定房间。它们依靠的不是提前存储的固定地图,而是“看懂画面 + 听懂指令 + 自己决定下一步走向”的综合能力。这正是视觉语言导航(VLN)要解决的核心问题。 然而,这类系统隐藏着一个很少被提及的前提:它完全相信自己的“眼睛”。摄像头拍到什么,它就把什么当作事实,并据此做出决策。 ▎真正的痛点是什么? 视觉是导航机器人最脆弱的入口。 机器人的所有判断都建立在像素之上,但真实世界的光照变化、物体遮挡,甚至镜头上的一点污渍,都可能让“同一段路”在它眼里变得完全不同。 越聪明,越怕“看不见的偏差”。 大模型加持的导航机器人推理能力更强,却也更加依赖视觉输入;一旦视觉输入被轻微扰动,小错误可能被一步步放大,最终演变成“走错整个楼层”的严重偏差。 更难的是“验伤”。 真实部署的机器人往往是封闭产品,攻击者或评测者拿不到它的内部参数和梯度,传统那种“拆开看脑子”的白盒评测方式根本用不上。而恰恰是在这种受干扰的情况下,我们最需要知道:它到底有多不靠谱? 过去的研究大多关注“怎么让机器人在干净环境里走得更准”,却很少有人问“它在被扰动时会不会崩溃”。香港科技大学(广州)陈昶昊教授团队提出的 AdvNav,正是要补上这个缺口:在不打开机器人、不依赖任何内部信息的前提下,仅通过观察它的行走行为,系统性地证明了当前视觉语言导航系统普遍存在一个“看不见的视觉软肋”。 AdvNav 是首个面向视觉语言导航任务的黑盒行为引导对抗攻击框架,相关成果已被 ACM Multimedia 2026(ACM MM 2026)录用。 01 为什么黑盒攻击导航系统很难? 传统图像分类中的黑盒攻击,通常只需要面对一次预测:输入一张图像,模型立刻给出分类结果,攻击者可以根据输出不断调整扰动。而视觉语言导航完全不同。 首先,智能体需要同时理解视觉信息与语言指令,并结合历史导航过程进行连续决策,属于典型的多模态时序任务。 其次,导航具有明显的长期依赖特性。某一步的错误决策未必意味着任务失败,智能体往往能够依靠后续推理重新回到正确轨迹。这种自我修正能力,让攻击难度大幅增加。 此外,导航任务的最终反馈具有明显的延迟性。攻击者通常只有在整个导航结束后,才能知道此次攻击是否真正导致任务失败。这种稀疏且滞后的反馈,使传统黑盒优化方法难以发挥作用。 因此,如何仅依靠智能体外部行为,在没有梯度信息的情况下持续优化扰动,成为 VLN 黑盒攻击的核心难题。 02 AdvNav 如何实现“不拆机也能攻击”? 针对上述问题,陈昶昊教授团队提出了 AdvNav。它的核心思路非常“克制”:不碰模型内部,只在机器人“看到的图像”上叠加一点点精心设计的扰动,然后观察它怎么走,再根据走出来的结果反过来优化这层扰动。 整个框架主要依靠两套机制: 双粒度反馈机制:从机器人的行为中提取“它有多偏离”的信号,代替白盒攻击中才能获得的梯度信息,用于指引攻击方向。 自适应扰动优化 + 遗传算法:在有限的“查询次数”预算内,把扰动的强度和形态调整到最有效的状态。 具体来看,AdvNav 设计了一种基于智能体行为的双粒度反馈作为优化目标,包括: - 轨迹级表现得分:利用标准 VLN 评估指标路径加权成功率(SPL)和导航误差(NE),构建联合轨迹级攻击表现得分; - 动作级奖励与轨迹偏离信息:从智能体每一步的动作选择与整体轨迹偏离程度中提取更细粒度的反馈,引导攻击过程持续寻找更具破坏性的扰动。 同时,通过扰动强度自适应调整和遗传算法优化噪声结构,AdvNav 在有限查询预算下就能获得高效攻击效果。 在经典 R2R 数据集上,AdvNav 针对 Transformer 架构的 HAMT 模型,以及基于大语言模型的 MapGPT 模型,分别取得了 49.70%、65.96% 和 87.30% 的攻击成功率,充分揭示了当前视觉语言导航系统普遍存在的潜在视觉脆弱性。 论文标题:AdvNav: Behavior-Guided Black-Box Adversarial Attacks on Vision-Language Navigation 论文地址:https://arxiv.org/abs/2607.11063
热门跟贴