七月的佛罗里达,多佛,一个潮湿闷热的午后。82岁的祖母莎伦·布赖特韦尔接起电话,听到电话那头传来女儿的哭声。那声音毋庸置疑:抽泣,语无伦次,苦苦哀求。说是出了车祸,一名孕妇受了伤,律师很快就会打电话来指导她怎么做。

布赖特韦尔把女儿拉扯大,曾抱着她摇晃,哄她入睡。半个世纪以来,她听过女儿的哭泣无数次,熟悉那声音的每一个音色细节。她做了任何一个母亲都会做的事:把信封里的现金全部倒出来,将一万五千美元交给了出现在她门口的一个快递员。等她意识到女儿根本没出任何车祸,钱和快递员早已消失。

打开网易新闻 查看精彩图片

她听到的那个声音根本不属于她的女儿。那是由生成模型合成的仿制品,素材取自公开互联网上获取的音频——可能来自一条社交媒体帖子,可能是一条语音信箱问候语,但一定只是几秒钟的日常说话声。那些情感内容,那份恐惧和眼泪,只是同一个模型按常规流程自动添加的。整个“表演”运行下来只花了几分钱。

据各大消费者研究机构过去十八个月的测试,如今克隆一个毫无防备之人的声音,最少只需三十秒的源素材。有些学术实验甚至仅用三秒就做到了。

这正是整个故事的关键转折点,也是美国悄然陷入一场前所未有的诈骗流行病的根源。2024年,美国老年人报告因各类骗局损失近五十亿美元,而联邦贸易委员会自己都认为这一数字被严重低估。该机构2025年12月提交给国会的最近一份报告估计,60岁及以上美国人因欺诈蒙受的实际损失在一百亿至两百亿美元之间。