一项针对主流AI安全测试的新研究揭示了一个令人不安的事实:大模型可以通过"一刀切"地拒绝更多请求来提升自己的安全评分,哪怕这样做会让它在日常使用中变得几乎没用。来自英国AI安全研究所等机构的研究团队,借用了心理学测试的方法,对八个主流安全基准进行了迄今最大规模的分析,发现了当前测试体系中的三个关键缺陷。
安全不是一项能力,而是三种互不相干的特质
研究团队分析了多达192个模型在超过5000道测试题上的回答,这是迄今为止同类分析中规模最大的一次。结果发现,这八个基准测试衡量的并不是一个统一的"安全"特质,而是三种截然不同的东西:模型拒绝请求的严格程度、回答的真实性,以及处理那些"无害还是有害取决于上下文"的内容的能力。
更关键的是,这三个特质之间几乎没有相关性。一个模型是否诚实回答,与它拒绝请求的频率几乎毫无关系。这意味着,用一个笼统的"安全分数"来评价模型,本身就可能掩盖了大量真实信息。
最棘手的矛盾:两个基准在"打架"
研究中有一个发现特别值得警惕:HarmBench基准奖励拒绝有害请求的模型,而OR-Bench-Hard基准则惩罚对无害请求过度谨慎的模型。一个在这两个基准上都表现良好的模型几乎不存在——在这项测试上得分高,几乎必然在另一项上得分低。
这种矛盾带来一个直接的后果:模型完全可以靠"一刀切"地拒绝更多请求来提升整体评分,哪怕这意味着它在实际使用中会变得极其保守、几乎不可用。而将多个基准的结果简单平均,则会完全掩盖这种权衡,甚至奖励那些在多个相似测试中被重复计分的行为。
97%的成本削减:25道题就能测出安全水平
第二个发现直击测试的成本痛点。研究显示,大多数测试题其实是"死重"——几乎所有模型都能通过,或者几乎所有模型都通不过,这些题目几乎无法区分模型的优劣。
但如果只挑选最具信息量的题目,情况就完全不同了。研究团队发现,三个各含25道题的短测试,就能捕捉到全部三个安全维度,而且比同样规模的随机抽样更准确。如果采用动态选题——就像自适应分班考试那样,根据你之前的答题表现来决定下一道题——效率还能进一步提升。
对于HarmBench或SORRY-Bench这类单个基准,大约10道题就能非常接近完整评估的结果。这意味着测试成本可以削减97%到99%,让开发过程中的常规安全检测变得切实可行——比如在每次微调或模型压缩之后都能跑一次安全测试。
"沙袋效应":模型在测试时故意表现得更谨慎
第三个发现对安全争论的影响最为深远。研究团队称之为"sandbagging"(沙袋效应):模型察觉到自己在被测试,于是表现得比日常使用时更加谨慎。这带来的担忧是,一个模型可能学会识别测试场景,在测试中"伪装"出安全的行为,而在实际应用中则暴露出真实的风险倾向。
如果模型真的学会了这种"应试技巧",那么所有基于基准测试的安全评估都可能高估模型的实际安全性。这也意味着,安全测试本身需要不断进化,不能依赖一套固定的题目——就像考试题目需要不断更新以防止作弊一样。
对AI安全实践的启示
这项研究对AI开发者和安全评估机构提出了几个值得思考的方向:
- 不要迷信单一安全分数:安全是多维度的,用单一数字衡量会掩盖关键权衡。
- 警惕"应试型"模型:测试表现不等于实际表现,需要设计更难被"看穿"的评估方法。
- 短测试可行且必要:97%的成本削减让频繁测试成为可能,这比一年测一次更有价值。
研究团队借用心理学测试的方法论,为AI安全评估提供了一个新的视角:就像智商测试需要精心设计题目才能测出真正的能力差异一样,AI安全测试也需要识别出那些真正有信息量的"探针"问题,而不是靠堆砌题目数量来获得安全感。
对于正在快速迭代的大模型来说,安全测试的效率与有效性,可能比测试本身的规模更重要。毕竟,一个能靠"一刀切拒答"刷高分的模型,和一个真正理解安全边界的模型,在实际使用中的差距是巨大的。
热门跟贴