编辑丨岑峰
花费上亿美元、集结顶尖算力训练出的大模型,正面临被恶意蒸馏、套壳甚至窃取核心数据的巨大风险。
就在2026年近期,Anthropic 公开披露了针对 Claude 的大规模疑似恶意蒸馏事件——攻击者利用欺诈账户和代理服务疯狂收集模型输出,试图低成本复制大模型的能力。残酷的现实证明:面对隐蔽的“白嫖”与盗用,仅靠账户封禁、访问控制等外部防御手段,已经防不胜防。
数据从何而来?模型是否被恶意克隆?这篇爆火的AI爽文到底是谁生成的?
为了回答这三个终极安全问题,建立一套严密的大语言模型(LLM)“身份认证”机制迫在眉睫。近日,来自西安交通大学、中国科学院信工所和澳大利亚迪肯大学的研究团队,在人工智能顶会 IJCAI 2026 发表了题为“Implicit Identity Technologies for LLMs: Fingerprinting and Watermarking across Datasets, Models, and Generated Content”的重磅综述论文,首次提出了大模型“隐式身份(Implicit-ID)”的统一理论框架。
该研究彻底厘清了行业内长期混淆的“水印”与“指纹”技术,系统梳理了贯穿数据集、模型、生成内容全生命周期的身份认证方案,为构建可信、安全、可追溯的大模型生态提供了全景式的技术指南。
论文作者来自西安交通大学、中国科学院信息工程研究所和澳大利亚迪肯大学,包括刘冰、王顺平、朱煜帆、余欣怡、黄晶、杜林康、裴红斌(通信作者)和罗玮。
arXiv 预印本:https://arxiv.org/abs/2605.29245
01
为什么大语言模型需要“隐形身份证”?
大语言模型的研发需要投入大量的数据、算力与工程资源,有公开报道和研究估算认为,GPT-4的训练成本达到亿美元量级。随着模型能力、应用范围和商业价值不断提升,与大模型相关的安全与治理问题也日益突出,包括模型参数泄露、未经授权使用、训练数据违规利用、模型输出滥用,以及生成内容来源难以识别等。
2026年以来,围绕模型输出使用边界与模型蒸馏合规性的讨论受到广泛关注。Anthropic公开称,其发现了利用欺诈账户和代理服务大规模访问Claude、收集模型输出并规避检测的疑似模型蒸馏活动。该事件凸显了仅依赖账户管理、访问控制和外部行为检测保护模型资产所面临的局限,迫切需要建立支持大语言模型资产保护与来源追溯的身份机制,从而回答三个基本问题:
数据集是否遭到未经授权的使用?
模型来自何处,是否经过复制、微调或其他改造?
内容是否由特定模型或某类模型生成?
指纹识别(Fingerprinting)与水印技术(Watermarking)由此迅速成为研究热点。然而,现有研究长期存在两大突出问题:一是概念边界不够清晰,不同文献对“指纹”和“水印”的定义存在交叉甚至混用;二是研究体系相对分散,数据集保护、模型所有权认证和生成内容检测通常被分别研究,缺少覆盖大模型全生命周期的统一视角。
针对这些问题,该综述提出大语言模型“隐式身份”这一统一框架,系统梳理大语言模型从数据、模型到生成内容的身份技术。
02
核心创新:打破术语混淆的“隐式身份”框架
论文提出了由“顶层概念-中层实现-底层机制”三个层次构成的概念框架。
在顶层,论文提出隐式身份作为统一抽象,用于描述大语言模型系统中不易被直接观察、但能够通过特定验证程序识别和确认的身份信号。大模型的身份需隐藏在参数、表示、行为响应或生成内容的统计规律中,需要借助特定算法、测试样本或密钥才能验证,因此被称为“隐式身份”。这一概念将原本分散的指纹和水印技术纳入同一理论框架,使研究者能够从“身份如何产生、证据从何而来、声明如何验证”三个基本问题出发,对不同方法进行统一分析。
在中层,论文根据身份信号的形成方式,将隐式身份划分为两种主要实现形式。指纹技术(Fingerprinting)是一种非侵入式身份技术,其身份信号来源于数据集、模型或生成内容自身固有的内在特征,例如模型的参数分布、内部表示、输入—输出行为模式或生成内容的统计特征,无需对原始资产进行主动修改。水印技术(Watermarking)则是一种侵入式身份技术,通过外部干预,将预先设计、可验证的身份信号主动嵌入数据集、模型或生成内容中。简言之,指纹识别是从资产的固有特征中“提取身份”,后通过相似性比较归因实现验证;而水印技术是在资产中主动“植入身份”,后通过密钥进行身份验证。
在底层,论文从证据来源和验证路径两个方面归纳现有方法,形成一个紧凑的隐式身份技术设计空间。不同方法所利用的身份依据可能来自数据集中的记忆与统计信号、模型参数及其统计不变量、模型内部表示与梯度、特定输入下的行为响应,以及生成内容中的词汇、句法、语义或分布特征。与之对应,验证路径主要包括两类:一类是不依赖预设密钥的相似性归因,即提取待验证资产的内在证据,并与候选来源的参考证据进行匹配;另一类是依赖预先嵌入身份信号和秘密信息的密钥验证,即通过相应检测器判断特定水印是否存在。
这一框架不仅澄清了长期存在的术语混淆问题,也为比较不同访问条件下的身份技术,以及推动方法、攻击模型和评估标准在数据集、模型与生成内容之间迁移复用,提供了分析基础。
03
跨生命周期的生成式分类体系
资产保护不应头痛医头、脚痛医脚。论文提出了一套横跨大语言模型生命周期与验证语义的二维分类体系(Taxonomy):
生命周期维度:按照身份建立或验证所处的资产阶段,将相关技术划分为数据集、模型和生成内容三个层面;
身份验证维度:根据验证语义区分为基于相似性的归因(对应非侵入式的指纹识别)与基于密钥的验证(对应侵入式的水印技术)。资产保护与来源追溯并不分别绑定于某一种技术,而是均可通过上述两种验证路径实现。
这种“生成性”的分类法不仅对现有研究进行归类,还揭示了不同资产层面之间共享的验证逻辑,从而帮助研究者推导方法、攻击模型和评估压力条件在不同生命周期阶段之间的迁移关系。
各资产层面的技术要点如下:
数据集层面:重点关注数据集指纹识别,包括统计指纹(基于损失、困惑度等记忆信号)和特定响应指纹,主要用于事后数据使用审计和所有权验证;
模型层面:技术最为丰富,涵盖参数空间指纹、表示空间指纹、行为指纹,以及通过微调、模型编辑等方式嵌入身份信号的模型水印方法;
生成内容层面:包括统计指纹、自然指纹,以及统计水印(红绿列表等)和带密钥采样水印(零失真水印等),可直接对输出文本进行溯源。
04
评估框架:如何评判身份技术的好坏?
为了让身份验证系统真正落地工业界,论文进一步建立了一套包含四个核心评估目标的评估框架,将隐式身份做为大模型身份验证的“体检标准”系统:
1.身份声明正确性(Correctness of Identity Claims)衡量验证系统能否接受真实声明、拒绝虚假声明。论文以真阳性率(TPR)和假阳性率(FPR)为核心指标,建议报告固定FPR下的TPR,或使用ROC曲线、精确率—召回率曲线进行评估;多源归因场景还应关注Top-k准确率和置信度校准。
2.良性变换鲁棒性(Robustness to Benign Transformations)衡量身份信号在数据处理、模型微调、量化、剪枝、蒸馏、模型合并,以及文本改写、翻译和摘要等正常变换后能否继续被验证。论文提出良性鲁棒性覆盖率,用于汇总身份方法在不同良性变换下保持有效的比例。
3.对抗操纵鲁棒性(Security against Adaptive Manipulation)评估身份技术面对移除、规避、伪造和冒充攻击时的安全性。论文强调应明确攻击者的知识、权限和能力,并以对抗鲁棒性覆盖率衡量方法在给定威胁模型下抵抗不同攻击的能力。
4.效用与部署成本(Utility and Deployment Cost)衡量身份技术对原有功能的影响及其实际应用代价。水印技术需重点评估嵌入身份信号造成的性能或文本质量下降;指纹识别通常不直接影响资产效用,但可能需要较高的查询、计算和存储开销。部署成本进一步分为身份建立成本和身份验证成本。前者包括数据构造、模型微调、模型编辑、解码干预和密钥管理等;后者包括查询次数、计算与存储开销、验证延迟及访问权限要求。即使方法具有较高识别性能,若依赖白盒访问或大量查询,也可能难以实际部署。
这一评估框架为后续研究提供了系统、可比较的评估模板,有助于推动领域向更规范、更实用的方向发展。
05
挑战与未来:大模型安防的“深水区”
尽管大语言模型身份技术突飞猛进,但该综述也指出了当前行业面临的三大痛点:
一是身份安全信息与模型效用的“跷跷板”,即如何在不牺牲模型聪明程度的前提下打上强力水印;二是对跨生命周期漂移和自适应变换的鲁棒性不足,面对模型迭代演化与自适应攻击,身份信号极易发生“漂移”和失效;三是验证过程往往需要极高的白盒权限或者算力开销、缺乏低成本且标准化的评测基准。
未来,语义保真度更高的身份机制、对模型演化和内容变换更加鲁棒的身份信号、更加高效且可审计的验证方法,以及覆盖数据集、模型和生成内容的评测基准,将是下一个黄金研究方向。
06
结语
随着大语言模型渗透进千行百业,如何实现模型、数据和生成内容的身份认证、知识产权保护与来源追溯,已成为可信人工智能不可回避的重要基础设施建设。这篇 IJCAI 2026 的重磅综述,梳理了隐式身份技术的发展脉络、统一框架和未来方向,为构建安全、可信、可追溯的大语言模型生态提供了参考。
论文完整版预印本请访问arXiv:https://arxiv.org/abs/2605.29245,进一步了解这一快速发展的研究方向。
雷峰网
热门跟贴