在 Cartesia 的 playground 里,Elvis Saravia 上传了大约 15 秒自己的录音。几秒钟后,一个能开口说话的"他"就出现了。
他让这个克隆声音说了一段日语。那是他本人不会讲的语言。
打开网易新闻 查看精彩图片
支撑这次尝试的是 Cartesia 最新的语音模型 Sonic 3.6。据他实测,该模型支持 44 种语言,克隆过程在几秒内完成。
Saravia 给出的判断很直接:这类能力可以让内容触达更多语言的受众。一个只会说英语的创作者,不必先学会一门外语,也能让自己的声音出现在另一种语言里。
从操作路径看,门槛被压得很低——一段十几秒的样本,一个浏览器里的 playground,剩下的交给模型。真正需要重新想的,是"这是谁在说话"这件事本身。
热门跟贴