如果考生提前知道了题目,即使考出满分也毫无意义。Google DeepMind用这个比喻来描述AI模型评测中的一个核心问题:基准测试污染。如果模型在训练阶段已经见过测试题,那么评测结果的可信度就只能打折扣。
为了堵住这个漏洞,Google DeepMind表示将启动首个针对专有前沿AI模型的双盲评测。外部测试数据被锁在密码学意义上的“盒子”里,模型无法在事后利用这些题目针对特定测试进行自我优化。试点项目由Google DeepMind与新加坡AI安全研究所等合作伙伴共同开展,测试对象是Gemini Flash Lite系列中的一个模型。
敏感评测的两难选择
过去,高度敏感的外部评测往往需要做出妥协。DeepMind指出,要么评测方交出测试提示词,让模型提供方提前看到题目;要么模型提供方交出模型权重,承担知识产权泄露的风险。Anthropic的一个模型在ARC-AGI基准测试中延迟评测,就是这种两难困境的一个近期例子——这家AI公司对其最强模型执行30天的数据保留政策。
双盲评测的设计目标就是消除这种取舍。Google使用Google Cloud机密计算产品组合中的Confidential Space来实现这一机制。该设置通过密码学方式验证外部测试数据和模型各自对所有者保持私密:评测方看不到Gemini的权重,Google也看不到测试提示词。
从合同约束到技术加密
在此之前,外部提示词的保密依赖零日志协议和合同保障。Google表示,加入技术和密码学保护是安全模型评测的一大进步。密码学证明的目标是防止测试污染并保护敏感数据。DeepMind认为,这一点对于网络安全评测或政府机构主导的测试等高度敏感场景尤为重要。
独立组织可以在不放弃数据主权或安全性的前提下,对先进模型进行严格测试。Google希望这一尝试能为模型监督树立新标准,并帮助行业构建更可靠、更受信任的AI系统。
热门跟贴