检索增强生成(RAG)系统正面临一种新型攻击:投毒文档不仅能让模型给出错误答案,还会让模型变得异常自信,使传统检测手段失效。

研究发现,RAG投毒会推高模型token置信度,同时让输出一致性上升。这意味着,模型在给出错误答案时反而表现得更加笃定,基于不确定性的检测器因此难以识别异常。

打开网易新闻 查看精彩图片

注意力崩塌:攻击的关键特征

研究人员观察到,攻击发生时,模型的注意力会异常集中于被投毒的文档,而非分散在多个检索证据之间。作者将这一现象称为“注意力崩塌”。

这一发现提供了新的防御思路:通过监控文档级注意力分布,或许能在答案明显出错之前就暴露投毒行为。相比之下,仅检查最终答案或置信度指标,很可能漏报攻击。