一个能力更弱、没有对齐的模型,把一件有害的事拆成几个看起来人畜无害的小问题,分别去问一个已经对齐的前沿模型,每个问题单独开一个会话,最后在自己这边把答案拼起来。微软的这篇安全论文,把这种做法叫做能力洗白(capability laundering)。

关键在于,每一次请求单独看都能通过审核。因为前沿模型给出的任何单个回答,都不构成一个有害任务。风险不在某一次问答里,而在拆分和拼装这两个动作上——它们都发生在被咨询的模型之外。

打开网易新闻 查看精彩图片

它到底是怎么绕过去的

这套流程有三个环节。发起方是一个较弱、未对齐的模型,它负责把目标拆解成若干子问题;被咨询方是已经对齐的前沿模型,每个子问题都在独立会话里提问;最后,所有答案回到发起方本地,由它自己完成组合。

对前沿模型来说,它看到的只是一个个孤立、正常的问题。没有任何一个回答越界,所以每一次请求都能顺利通过。论文作者把这种现象命名为能力洗白,指向的正是这种"单点合规、整体有害"的错位。

实测数据:14道题里追回8道

论文给出的测试结果相当具体。在 CyBench 基准上,Gemma-4-31B 单独作答时失败的任务,在咨询 GPT-5.5 之后,14 道里有 8 道被它重新做了出来。

另一组测试针对 CBRN 攻击链。引入咨询环节后,这个较弱模型的平均评分从 62.3 提升到了 83.1。被咨询的模型包括 GPT-5.5Claude Opus 4.8Grok-4.3

这组数字说明的问题很直接:一个本身不具备完成能力的模型,可以通过借调前沿模型的能力,把原本做不到的事做到,而且整个过程没有触发任何单次请求层面的拦截。

为什么单次审核挡不住

现有的安全机制大多建立在"判断这一次请求和回答是否有害"之上。能力洗白恰好绕开了这个判断维度——它把有害性藏进了任务的结构里,而不是任何一次具体的交互中。

拆分发生在发起方,拼装也发生在发起方。被咨询的前沿模型全程只看到零散、无害的子问题,它既不知道这些问题的来龙去脉,也不知道答案最终会被用在哪里。每一次会话都是干净的,合起来却指向一个有害目标。

论文地址为 academy.dair.ai/papers/divide-…,发布时间为 2026 年 9 月 16 日。

这件事的分量在哪

过去讨论模型安全,焦点通常放在被对齐的模型会不会被越狱、会不会被诱导说出不该说的话。这篇论文把视角挪到了另一个位置:即便前沿模型本身守得住,只要有一个未对齐的弱模型在中间做调度,它的能力依然可能被间接调用

发起方越弱,反而越不容易被注意;被咨询方越强,能提供的帮助就越大。两者之间的能力差,恰恰成了这套方法成立的前提。对做安全评估的人来说,需要重新考虑的不只是单次问答的合规性,还有跨会话、跨模型的任务拼接路径。