每一家做AI智能体安全检测的公司都会公布一个检出率,我们此前也这么做。但问题在于,这些数字没有一个是可以核验的。你看到“99%检出率”或“100%拦截提示注入攻击”,但背后没有测试集、没有失败清单、没有方法论,没有任何可以实际运行的东西。你只能选择相信。

我认为在安全领域,要求用户“相信”是不对的。所以我公开了我们的基准测试,连那些并不光彩的部分也一并保留。地址在这里:https://github.com/AndrewSispoidis/contemporary-agent-attacks

基准内容如下:497个攻击样本和1172个良性样本,总计1669个,覆盖22个类别。检测引擎在攻击样本上达到99.8%的检出率,误报率为0.09%。许可证为CC BY 4.0。方法论和评分代码都在仓库里,你可以克隆下来复现每一个数字。

我更在意的是失败案例。基准里直接点名了它们:有一个引擎漏掉的攻击,是一段借口式开场白,从未真正索取任何不该索取的内容,因此在被检测的时间点上没有可捕获的异常;还有一个被误报的良性样本,是Stack Overflow上一个关于Go语言方法接收者语法的问题,它的形态像探测指令,但并不是。两个案例都按名称列在仓库中。如果你运行一遍,你会遇到且只会遇到这两个,不会有意外惊喜。

为什么我认为这对整个类别很重要?当检测数字无法被复现时,它们就不再承载任何信息。供应商可以宣称任何数字,买家又无法核实,于是最终决策取决于谁的营销做得最猛。这不是选择安全产品的正确方式。一个可以运行的、能诚实面对自身缺陷的基准,才提供给你真正可评估的依据。

我宁愿在人们可以验证的数字上竞争,而不是在需要人们凭信任接受的数字上竞争。如果你从事智能体安全工作,或者正在评估这类产品,请克隆这个基准,然后告诉我它哪里有问题。真正的价值对话,恰恰发生在那些失败案例上。