8月19日,武汉警方专门做了一次AI仿声反诈提醒。
民警给出的警告很直接:骗子拿到几秒钟语音,就可能利用AI生成高度相似的声音。素材可能来自短视频、直播连麦、微信群语音,也可能只是一次陌生电话里随口说出的几句话。武汉警方把“3—10秒语音素材”作为需要警惕的风险场景。
这听起来像一种还没大规模发生的新骗局。其实案子已经出现了。
一、电话那头,已经不一定是那个人
2025年4月,湖北黄石,一位70多岁的老人接到“孙子”的电话。
电话里,孙子带着哭腔,说自己在学校打伤了人,要赔4万元私了,还特意叮嘱奶奶不要告诉别人。老人听着就是孙子的声音。她准备了2万元现金。有人上门取钱时,为了让她放心,还当面再次拨通“孙子”的电话确认。
当天,另外两名老人也遭遇了几乎相同的骗局。一个“孙子打伤同学”,一个“需要到公安机关赎人”,三位老人一共被骗6万元。
后来查明,电话里的亲属声音使用了AI拟声技术。2026年2月,这起案件还被最高人民法院作为典型案例公布。
把场景换到公司,金额会大得多。
2024年1月底,香港一家跨国公司的员工收到“英国总部CFO”的消息,随后参加了一场多人视频会议。会议里不只有CFO,还有几名熟悉的同事。脸是熟悉的,声音也是熟悉的。员工最终按照要求授权转账,损失约2亿港元。
香港警方后来调查发现,骗子事先下载了公开的影像和声音素材,再用深度伪造技术制作会议内容。所谓“多人会议”,实际上大量内容是预先生成的。
几个月后的2024年5月,香港又出现类似案件。
一名跨国贸易公司员工收到假冒英国总部CFO的WhatsApp消息,并参加了近30分钟的视频会议。会议里的“老板”要求转账,员工随后转出近400万港元。警方判断,骗子同样使用网上公开的视频作为素材进行深度伪造。
三个案子放在一起,很容易发现一个变化:
骗子以前最难解决的问题,是“怎么让你相信我就是那个人”。现在,这道门槛正在下降。
二、第一步:AI先从声音里找到“你是谁”
一个人说了几十年话,AI为什么几秒钟就敢模仿?
因为机器要找的,并不是你说过哪些句子。它先听另外一些东西。
你的声音偏高还是偏低,音色偏亮还是偏暗,说话快还是慢,尾音怎么收,一个词和下一个词之间习惯停多久。还有一些更细的东西。气声、鼻音、口音,甚至同一个音节从开始到结束时声音怎样变化。
我们平时听不出来这么多层。我们只会说:“这就是他的声音。”模型会把这些差别变成数字。最后留下来的,不再是一段完整录音,而是一组用来描述这个声音的特征。也可以把它粗略理解成一张声音身份证。
三、第二步:把“说什么”和“谁在说”拆开
这里才是声音克隆最关键的一步。一句“我今天晚一点回来”,在人听来是一句话。模型却可以把它分成两个问题。第一个:这句话说了什么?第二个:是谁在说?“我今天晚一点回来”这几个字,可以不变。换一个人来说,音色、节奏、重音、停顿都会变。
今天的语音模型在训练时已经接触过大量人声,它并不需要从你的几秒录音里重新学习普通话怎么念、句子怎么组织。
这些能力以前已经学过了。现在缺的只是最后一项信息:这句话,要用谁的声音说。所以那几秒录音发挥的作用,更接近一次“定位”。
模型从里面寻找你的音色、语调和节奏,把这个声音大致放进一个已经学好的声音空间里。位置找到以后,再输入一句你从来没说过的话,系统也可以尝试让它带上相同的声音特征。
所谓“几秒钟学会一个人”,其实很容易让人误解。它不是几秒钟学会了说话。它早就学会了说话,那几秒钟只是告诉它这一次要像谁。
四、第三步:骗子要复制的其实不只是一副嗓子
回头再看黄石那起案件,就能看出问题所在。
如果电话里只是机械地说一句“奶奶,我需要钱”,未必有人相信。骗子同时放进去了几样东西:熟悉的声音;“孙子出事”这个身份关系;打伤同学这个突发事件;马上赔钱这个时间压力;以及“千万别告诉别人”这句话。声音负责让老人相信“这是孙子”。后面的恐慌和催促,则让她没有时间去找真正的孙子确认。
美国联邦贸易委员会总结类似“家庭紧急事件”诈骗时,也反复提醒几个共同特征:事情特别急、要求保密、催促立即付款,并刻意阻止受害者联系其他家人核实。FTC已经明确提醒,即使电话里的声音听起来就是自己的亲属,也不能只凭声音确认身份。
企业里的逻辑也一样。假CFO的视频之所以有效,不只是脸和声音做得像。还有职位。有“机密交易”。有上级对下级发出的指令。有会议这种看起来非常正式的场景。
AI负责把身份做得更像,诈骗仍然在利用人原有的信任关系。这也是声音克隆比单纯“模仿声音”麻烦得多的地方。它可以和社交资料、大模型生成的对话、伪造头像、视频会议继续往下拼。
声音,只是其中的一层。
结语
过去接到一个电话,我们会先听声音。像父亲,就是父亲。像孩子,就是孩子。像老板,就是老板。这个经验之所以长期有效,是因为复制一个人的声音曾经太难。
现在这个前提正在变化。
音色可以提取,语速可以分析,停顿可以建模,口音也可以变成数据。当这些东西能够和一句新的文字重新组合以后,一段声音只能说明:有人生成了这样的声音。却未必能够证明,那个人真的说过这句话。
所以以后再遇到“家人出事”“老板急着转账”这样的电话,最有效的动作反而很朴素:挂掉。用自己保存的号码重新联系本人。
因为骗子可以控制他打给你的那通电话,却控制不了你主动建立的第二条联系。
听起来像你,只能说明它像你。至于电话那头到底是谁,还得另外确认。
而声音之后,下一道身份防线也已经开始松动:
如果声音可以复制,视频里的老板,为什么也可能是假的?
热门跟贴