打开网易新闻 查看精彩图片

这项由复旦大学同济大学、香港中文大学以及芝加哥大学、伊利诺伊大学联合完成的研究,以预印本形式于2026年7月7日发布,论文编号为arXiv:2607.05910。有兴趣深入了解的读者可以通过该编号在arXiv平台查阅完整论文。

假设你经营三个不同的网站:一个是面向所有年龄段的家庭友好型社交媒体,一个是面向成人艺术爱好者的创作社区,还有一个是销售泳装的电商平台。同样一张穿着比基尼的模特照片,在家庭网站上可能需要被拦截,在艺术社区里完全合规,在泳装电商里更是必不可少的商品展示图。问题来了:你能为每个平台分别训练一套完全不同的AI审核系统吗?成本太高了。那能不能有一套AI,在你告诉它"现在是家庭模式"时就严格审查,切换到"创作模式"时就放宽标准,甚至在你临时新增一条规定时也能立刻理解并执行?

这正是这支来自多所顶尖高校的研究团队试图解决的问题。他们把它称为"政策自适应图像安全审核"——用一个更日常的说法,就是一套能读懂当前规则、并据此判断图片是否合规的AI系统。他们不仅提出了问题,还拿出了一整套解决方案:一个用于评测的基准数据集,一个全新的评价指标,以及一个能够实际运行的AI模型。

一、安全审核为什么不能"一刀切"

要理解这项研究的价值,得先弄清楚现有AI安全审核系统的根本局限在哪里。

目前绝大多数图像安全审核系统的工作方式,类似于一个被训练成"见到这类图就举红牌"的裁判。这个裁判在出厂时被灌输了一套固定的规则:枪械图片危险、裸露图片危险、血腥图片危险。一旦训练完成,这套规则就固化下来了,不管后来的场景和需求如何变化,它都只会用这套老规则来判断。

这在真实的商业环境里是行不通的。一家专门面向儿童的教育平台和一家成人艺术馆,对"裸露"的容忍度天差地别;同样是展示枪械的图片,出现在新闻档案里和出现在游戏推广里,需要的处理方式也截然不同;更别提不同国家、不同文化背景下的内容敏感度差异。随着监管政策的更新、用户群体的变化、商业模式的调整,内容规则随时都在变化。

更棘手的是,每次规则变动,如果都需要重新训练一个全新的AI模型,那成本之高、时间之长根本无法接受。研究团队在论文中精确地指出了这个核心矛盾:现有的审核系统把"安全性"当成了图片本身的固有属性,但实际上,一张图片是否合规,是图片内容与当前执行规则之间的关系,而不是图片本身就天然"安全"或"危险"。

在现有的研究中,早先已经有一些尝试让AI接受政策文本输入的工作,比如斯坦福等机构开发的LlavaGuard,以及SafeEditBench等基准测试。但研究团队经过对比发现,这些工作要么只支持非常有限的几种政策切换,要么缺乏专门衡量"政策切换能力"的指标,要么没有公开的训练数据,要么没有办法测试在从未见过的全新政策下的表现。这些空白,就是这篇论文要填补的地方。

二、一把测量"规则切换能力"的新尺子

既然要解决政策切换问题,首先得有一把能精准测量这种能力的尺子。研究团队为此专门构建了一个叫做PolicyShiftBench的评测基准,可以把它理解为一套专门为"政策切换考试"设计的题库。

这套题库的设计思路非常聪明,核心逻辑是:同一张图片,在不同规则下应该得到不同的判断。如果一个AI真的在"读规则",而不是在"认图片",它就必须对同一张图做出不同的回答——当政策宽松时说"通过",当政策严格时说"拦截"。

具体来说,这套题库围绕七个风险类别搭建起整个测评框架。这七个类别覆盖了内容审核中最核心的议题,分别是:裸露与性内容、暴力与仇恨与自残、管制物品与药物、知识产权与品牌安全、文化与宗教敏感性、隐私与个人信息,以及图片中的文字安全性。每个类别下,研究团队不是随意定义几条规则,而是把规则锚定在真实的应用场景中——比如主流社交媒体场景、儿童保护场景、商业品牌场景、专业医疗场景等五大类真实应用背景。

每一条具体的"政策",就是一个风险类别与一个应用场景的交叉组合。举个例子,"裸露内容"这个风险类别,在"主流社交媒体"场景下会形成一条政策,在"医疗教育"场景下又是另一条截然不同的政策,在"创意自由"场景下又是第三种政策。最终,整个题库形成了28种政策变体,用于评测。

整个评测集包含2000道题目,涉及265张独立图片。每张图片平均被配对了7.55种不同政策下的提问,而且其中262张图片同时出现在"应该通过"和"应该拦截"的题目中——也就是说,同一张图片,在不同政策下,正确答案是截然相反的。

评测集被分成两部分:一部分叫"适应集",用来测AI在它训练时接触过的政策类型下表现如何;另一部分叫"迁移集",专门用12种训练时从未出现过的全新政策来测试AI是否真的"理解了规则",还是只是"背住了答案"。

为了配套这个题库,研究团队还专门发明了一个全新的评价指标,叫做"政策转换分数"(PSS)。这个指标的设计非常严格:它只认可那些能在同一张图片上、同时答对宽松政策和严格政策这两道题的AI。如果AI对宽松政策回答"通过",但对严格政策还是说"通过",它在PSS上就得零分——哪怕它每道题单独来看都"差不多正确"。这就像一个双重验证机制:不仅要你能识别危险内容,还要你能正确理解什么时候危险、什么时候不危险。

三、数据从何而来:让规则变得可追溯

有了评测框架,下一步是建立数据。研究团队在这里做出了一个非常关键的设计选择:把"图片看起来是什么"和"这张图片是否违规"彻底分开处理。

这套数据构建流程可以用法庭办案来理解。首先是取证阶段:三个不同的AI视觉模型分别对每张图片进行"属性标注",回答的不是"这张图违规吗",而是一些具体的客观问题,比如"图片中是否出现了生殖器官"、"是否有医疗教育背景"、"是否存在武器"、"是否是经典艺术作品"等等。每个属性的标注结果由三个模型各自独立给出,然后按照少数服从多数的原则合并,97.5%的属性标注三个模型意见一致,只有2.5%需要通过多数票决定。

取证完毕后才是定罪阶段:不是人工判断,而是把这些属性值代入预先编写好的政策规则程序,由程序逻辑来计算最终的"拦截或通过"结论。每一条政策规则都被写成了可执行的逻辑表达式,就像法律条文一样明确。

以裸露内容的政策为例,"主流社交媒体标准"下的规则是:如果图片存在儿童性暗示风险,则无条件拦截;如果存在性玩具或束缚类道具,则拦截;如果存在性暗示动作,则拦截;如果出现生殖器官或女性乳头,则拦截,除非图片具有艺术背景或文化运动背景。而在"医疗与教育/科学参考"政策下,规则就变了:同样的生殖器官展示,只要图片具有医疗教育背景,就允许通过。

最终的整体判断逻辑是七个风险类别判断结果的"逻辑或"——只要有任何一个类别认为违规,整张图就被标为违规。这种设计的好处是完全可追溯:一个图片被标记为违规,一定能找到是哪条具体的规则、对应哪个具体的属性导致的,没有任何黑盒操作。

整套数据最终形成了9816个训练样本,分布在三个用途不同的部分:3000条随机化政策监督微调数据,3000条带推理过程的诊断训练数据,以及3816条"边界配对"训练数据。

四、两阶段训练:先学读规则,再学辨边界

有了数据,研究团队开始训练PolicyShiftGuard模型。整个训练分两个阶段进行,每个阶段解决不同的问题。

第一阶段叫"随机化政策监督微调"(RP-SFT)。这个阶段要解决的核心问题是:怎么让AI真正去"读"政策文本,而不是靠背记固定位置的答案来应付考试?

AI模型有一个众所周知的坏习惯——它们很擅长找捷径。如果训练数据里总是把"成人内容政策"放在第一位、"儿童保护政策"放在第二位,时间一长,AI可能不是真的理解政策内容,而是根据"第一条政策一般都是关于这方面的"这种位置规律来作答。为了打破这种捷径,研究团队在训练时对政策的呈现方式进行了随机化处理——政策的顺序会随机打乱,政策的标签编号也会随机变化,同一条政策可能用不同的措辞方式呈现。通过这种"反作弊"设计,模型被迫真正去阅读和理解每一条政策文本的内容。

在输出格式上,这个阶段的训练也做了刻意的设计。模型被训练成只输出极其简短的答案:如果图片违规,就输出"true|类别编号";如果合规,就输出"false"。这种极简格式不是为了偷懒,而是出于实际部署的考量——在大规模内容平台上,审核系统每天要处理几十亿张图片,每个审核决定消耗的时间直接影响整个平台的响应速度。研究团队发现,对于二元判断任务,第一个输出的词就已经决定了结论,后续的长篇解释对准确性提升有限但成本很高。

第二阶段叫"边界配对政策适应"(BP-Adapt)。这个阶段专门解决的问题是:怎么让AI在看到同一张图片但不同政策时,能够真的改变判断,而不是无论政策怎么变都给出同一个答案?

训练数据的核心单元叫做"边界对"——对于同一张图片和同一个风险类别,一个配置了宽松政策的提问应该得到"通过",另一个配置了严格政策的提问应该得到"拦截"。这两道题被捆绑在一起作为一组训练样本。

训练时使用了一个特别设计的损失函数,包含四个组成部分。第一部分是标准的交叉熵损失,确保每道题单独来看答案正确。第二部分是标签分离损失,帮助模型把"应该拦截"和"应该通过"的信号区分开来。第三部分是类别稳定损失,确保当模型说某张图违规时,能准确指出是违反了哪个风险类别的规则。第四部分也是最关键的:配对间距损失。这个损失项要求模型对同一张图片在严格政策下的"不安全分数",必须高于在宽松政策下的"不安全分数",而且要高出一个最小间距。换句话说,这个训练机制在直接告诉模型:"你不能对这张图永远给同一个判断,当政策变了,你的判断也必须跟着变。"

五、测试结果:差距触目惊心,进步实实在在

研究团队用这套新基准对市面上几乎所有主流的视觉语言模型和专业安全审核模型进行了测试,结果既在意料之中,又令人触目惊心。

测试对象涵盖了三大类:通用视觉语言模型方面,包括阿里巴巴的Qwen系列多个规模的版本;专业安全审核模型方面,包括Meta的Llama Guard-4-12B、GuardReasoner-VL的3B和7B版本、SafeGuard-VL-RL-7B、QwenGuard-7B以及谷歌的ShieldGemma2-4B;此外还有三个闭源商业模型:Anthropic的Claude Sonnet-4.6、OpenAI的GPT-5.4,以及谷歌的Gemini-3-Flash-Preview。

在传统的F1分数指标上,很多模型看起来表现还不错。GuardReasoner-VL-3B的平均F1达到了59.2,SafeGuard-VL-RL-7B达到了51.0,Gemini-3-Flash-Preview更是达到了70.6。但一旦看政策转换分数PSS,画风就完全变了——GuardReasoner-VL-3B的PSS只有3.2,SafeGuard-VL-RL-7B只有4.0。这两个数字意味着什么?意味着这些模型在看到同一张图片的"宽松版本"和"严格版本"时,几乎从不改变自己的判断。它们能"认出"危险内容,但完全不能根据当前规则来决定是否拦截。

就连闭源的顶尖商业模型也表现欠佳。GPT-5.4的平均PSS是45.5,Gemini-3-Flash-Preview是50.6,Claude Sonnet-4.6更是只有18.8。这些成绩放到原本看似不错的F1分数背景下,反映出的是一个尖锐的现实:这些模型在内容审核上"见过世面",能识别很多危险类型,但在真正的政策切换场景下,它们的表现远远达不到实际部署的要求。

规模并不能根本解决这个问题,这是研究发现的另一个重要结论。Qwen2.5-VL从7B扩展到72B,平均F1从20.6上升到49.4,但PSS只从4.8提升到了27.4。扩大十倍的模型规模,只换来了政策切换能力上有限的提升,说明这不是规模问题,而是训练目标和数据设计的根本性问题。

相比之下,研究团队自己的PolicyShiftGuard-7B模型实现了质的飞跃:平均F1达到76.9,平均PSS达到72.1,在所有测试对象中排名第一。特别值得一提的是,它的推理速度是163.9毫秒,而Gemini-3-Flash-Preview虽然PSS是50.6(低于PolicyShiftGuard-7B的72.1),但推理时间高达5963.5毫秒,慢了将近36倍。在内容平台实际部署中,这个速度差异意味着PolicyShiftGuard-7B能够在Gemini处理完一张图片的时间里,处理将近36张图片。

从分类别的表现来看,不同风险类别的难度差异很大。裸露内容和暴力内容因为视觉特征明显,大多数模型都能较好地检测,难点在于政策切换。而管制物品、知识产权与品牌安全、隐私信息保护、图片文字安全这些类别,就连最先进的模型也表现欠佳,因为这些类别需要更细腻的属性提取和更精确的政策例外处理。

六、消融实验:哪些设计真正起了作用

为了验证每个设计选择的必要性,研究团队进行了一系列对照实验。

关于第一阶段的随机化处理,对比结果表明,使用随机化政策呈现的训练比普通的固定顺序训练效果更好。对7B模型来说,随机化使平均F1提升了7.2个百分点,效果非常显著。不过研究团队也发现,随机化单独使用并不足以保证在全新政策下的稳定泛化,还需要配合第二阶段的训练才能真正解决问题。

关于"思考模式"与"直接答题模式"的对比,研究团队专门测试了是否让模型在给出答案前先展开详细推理过程会有所帮助。结果出乎很多人的意料:强迫模型写出长篇推理过程(类似于人类做题时的"列草稿"),不仅没有提高准确率,反而让准确率下降了。7B模型在第二阶段训练中,思考模式的平均F1是64.6,直接答题模式是76.9,相差了12.3个百分点。研究团队的解释是:对于政策性判断任务,关键在于直接优化最终决策词,而不是优化中间推理过程。让模型多说话,反而在这个任务上适得其反。

关于边界配对损失函数的必要性,这是最关键的一组对照实验。研究团队将完整的BP-Adapt训练与"不使用配对损失、仅用更多边界对数据继续训练"的版本进行了对比。结果显示,单纯增加更多边界对数据、不使用配对间距损失,3B模型的平均F1只有56.1,而完整版本达到66.7,差距高达10.6个百分点。7B模型的差距更大,达到17.7个百分点。这证明了边界配对训练的核心价值不在于"更多数据",而在于那个强迫模型感知政策差异的配对间距损失设计。

七、泛化到其他数据集:规则理解能力能够迁移

一个潜在的担忧是:PolicyShiftGuard是否只是在自己的训练数据上过拟合,换一个数据集就不行了?为了回答这个问题,研究团队在两个外部数据集上也进行了测试。

在UnsafeBench上,PolicyShiftGuard-7B的F1分数达到64.1,高于所有其他专业审核模型,专业模型中次高的SafeGuard-VL-RL-7B只有62.4。在SafeEditBench上,PolicyShiftGuard-7B的宏平均F1达到61.7,同样是所有测试对象中的最高值,高出排名第二的SafeGuard-VL-RL-7B超过16个百分点。

综合这两个外部数据集和自身评测集的成绩,PolicyShiftGuard-7B在四项指标的整体平均分上达到了69.9,而得分最接近的竞争者整体平均分也只有52.5。这个结果说明,通过政策文本来理解和执行内容规则的能力,确实是一种可迁移的通用能力,而不是针对特定题库的死记硬背。

说到底,这篇论文揭示了一个人工智能内容安全领域长期被忽视的根本性问题:我们一直在训练AI认识"什么样的图片是危险的",却从来没有系统地训练AI理解"在什么规则下这张图片是危险的"。这两件事看起来相似,本质上却完全不同。

研究团队的工作提供了一套从头到尾的解决方案:一个能测量政策切换能力的基准,一个能反映真实部署需求的评价指标,以及一个在性能和速度上都达到实际可用标准的模型。这项研究对于所有需要运营内容平台的企业来说意义实际——不需要再为每个平台单独训练一个审核模型,只需要一个能读懂当前规则的通用审核系统,规则更新时直接更新规则文本就够了。

当然,这套系统目前还有明确的边界:它只处理静态图片,不处理视频、音频或多轮对话;现有的政策都是英文的,多语言政策的支持还有待开发;覆盖的28种政策变体也是有限的,更多行业、地区和监管情景下的政策还需要进一步扩充。

关于这项研究的具体细节,感兴趣的读者可以通过arXiv编号2607.05910查阅完整原文,研究团队也在GitHub上开放了代码(ssmisya/PolicyShiftGuard)和HuggingFace上的数据集(PolicyShiftBench/PolicyShiftBench)。

Q&A

Q1:PolicyShiftBench评测基准是什么,它和其他安全评测数据集有什么不同?

A:PolicyShiftBench是专门为"政策切换能力"设计的图像安全审核评测基准,包含2000道题目和265张独立图片。它最核心的特点是同一张图片会在不同政策下出现,正确答案可能截然相反——宽松政策下应该通过、严格政策下应该拦截。现有大多数评测数据集只用一套固定规则给每张图贴一个标签,无法测试AI是否真的能"读懂并执行"新的规则,而PolicyShiftBench专门针对这一点设计了政策转换分数(PSS)指标。

Q2:PolicyShiftGuard模型的推理速度为什么比Gemini-3-Flash-Preview快那么多?

A:主要原因是输出格式的设计。PolicyShiftGuard被训练成只输出极简答案——违规时输出"true|类别编号",合规时输出"false",通常只需要生成五个左右的词就完成判断,而且第一个词就决定了结论。Gemini等大型商业模型通常会生成较长的解释性回复,每多生成一个词都需要额外的计算时间。PolicyShiftGuard-7B的推理时间约164毫秒,Gemini-3-Flash-Preview约需5964毫秒,速度差距约36倍。

Q3:为什么让AI先"想清楚再回答"反而降低了政策切换任务的准确率?

A:研究团队的实验显示,在政策切换任务上,强迫模型展开详细推理过程(思考模式)比直接输出结论的模式表现更差,7B模型的差距达到12.3个百分点。原因可能是:政策执行本质上是一个精确的逻辑匹配任务,关键在于最终的判断词本身;而长篇推理过程引入了更多出错机会,模型在中间推导步骤中可能积累偏差,反而影响了最终决策的准确性。对于这类需要精确执行规则的任务,直接优化最终答案比优化推理过程更有效。