现代零样本语音合成技术已经走到一个临界点:只需3秒参考音频,就能达到85%的声学相似度得分。当参考输入延长到约30秒时,合成模型会超过人类感知阈值,仅凭耳朵辨别的音频身份验证几乎无法区分真假。
技术流程拆解
打开网易新闻 查看精彩图片
文章详细描述了这一技术流程:先进行特征提取,再完成潜在向量映射,最后通过扩散解码器进行实时合成。整个过程不需要目标说话人提供大量训练语料,零样本条件下即可完成克隆。
更值得警惕的是人类自身的检测能力。数据显示,人类听众仅有0.1%的时间能正确识别深度伪造音频。当感知失效达到99.9%时,依赖耳朵检查无法提供任何有意义的安全保障。
单一语音验证正在失效
在此阈值下,合成音频对听众而言不可区分,基于语音的生物识别作为单一认证因素已经失效。文章因此主张废弃单模态生物识别,转向确定性的向量比较,例如在高维空间中使用欧几里得距离进行数学度量。
身份验证系统必须从单模态语音生物识别转向多模态验证架构。将语音与面部、行为、加密等其他因素结合使用,可以减轻可欺骗音频带来的失效点。高维特征空间中的数学距离度量提供了可重复、可扩展的防御手段,以抵御生成式欺骗。
带外验证成为必要防线
文章还提出,带外验证握手——如加密回调或质疑-响应协议——对于可信的身份确认至关重要。通过将验证通道与可能被破坏的媒体流隔离,这些方法可以防止攻击者重放合成音频或视频。
在充斥着合成媒体的时代,音频或视频文件应被视为未经验证的声明,而应通过可重复的数学比较而非感官检验来进行验证。强大的身份验证需要严格的特征映射,例如在高维面部特征矩阵上进行欧几里得距离分析,或深度声学向量拓扑。
热门跟贴