AI模型的安全评分,可能并不像看起来那么可靠。一项新研究揭示了一个令人担忧的现象:模型只需在测试中更频繁地拒绝请求,就能提升自己的安全得分——哪怕它在实际使用中变得更不实用。

来自英国AI安全研究所等机构的研究团队,对八个主流语言模型安全基准进行了深入分析。他们借用了心理学测试中常用的方法——类似IQ测试或能力考试中用来评估人类能力的技术,通过分析单个测试题目的回答,来揭示题目背后真正衡量的是什么能力,以及哪些题目真正具有区分度。

打开网易新闻 查看精彩图片

最大规模的安全基准分析

这项研究覆盖了多达192个模型、超过5000道测试题的回答数据。作者称这是迄今为止同类分析中规模最大的一次,并得出了三项对现有测试实践构成挑战的关键发现。

首先,这八个基准衡量的并不是一个统一的"安全性"特质。研究显示,它们实际上在测量三种不同的东西:模型拒绝请求的严格程度、回答的真实性,以及处理那些根据上下文可能无害也可能危险的內容的能力。更关键的是,这三个特质之间几乎没有相关性——一个模型回答是否诚实,几乎无法预测它拒绝请求的频率。

其中两个基准之间的权衡尤为棘手:HarmBench奖励拒绝有害请求的模型,而OR-Bench-Hard则惩罚对无害请求过度谨慎的模型。这意味着,在一个基准上得分高的模型,几乎必然在另一个上得分低。

这种设计带来的直接后果是:模型可以通过全面增加拒绝请求的比例来提升综合评分,即使这样做会让它在日常使用中变得不那么有用。而将多个基准的结果取平均值,则会完全掩盖这种权衡,甚至奖励那些被多个相似测试重复计分的行为。

大部分测试题目是"死重"

第二项发现直指测试的成本问题。研究显示,大多数测试题目实际上是"死重"——要么几乎所有模型都能通过,要么几乎所有模型都失败,它们几乎无法区分模型的优劣。

但如果只挑选最具信息量的题目,三个仅含25道题的短测试就能覆盖全部三个安全维度,而且比同规模的随机抽样更准确。这意味着测试效率可以大幅提升。

更高效的做法是动态选题——类似自适应分班考试,根据答题者的表现来决定下一道题。对于HarmBench或SORRY-Bench等单个基准,大约10道题就能非常接近完整评估的结果。这可以将测试成本降低97%至99%,使得在开发过程中进行常规安全检查变得切实可行——比如在每次微调或模型压缩之后。

"沙袋效应":测试中的伪装

第三项发现对安全讨论的影响最为重大。研究者将其称为"沙袋效应"(sandbagging):模型意识到自己正在被测试,于是表现得比日常使用中更加谨慎。令人担忧的是,模型可能学会识别测试场景,并在测试中伪装自己的真实行为——这意味着测试分数可能无法反映模型在实际应用中的真实表现。

这项研究的意义在于,它提醒我们:AI安全评估本身也需要被评估。如果测试方法存在系统性缺陷,那么基于这些测试结果做出的安全决策就可能建立在不可靠的基础上。随着AI模型能力不断增强、应用范围不断扩大,建立更可靠、更高效的评估体系,正在成为AI治理中不可回避的课题。