语音克隆的门槛,被Inworld拉到了新低。这家公司最新发布的Realtime TTS-2,只需5-15秒的音频样本,就能克隆出一个人的真实声音。官方宣称,该模型在Artificial Analysis的评测中位居榜首。

这次发布包含两个版本:Realtime TTS-2(正式商用版)和面向低延迟、高并发场景的TTS-2 Flash。前者主打音质与自然度,后者则牺牲部分表现力换取更快的响应速度,适合实时交互类应用。

打开网易新闻 查看精彩图片

专业级克隆仍需耐心

如果你追求更高质量的克隆效果,Realtime TTS-2也提供了专业级语音克隆方案,目前处于beta阶段。代价是需要提供10分钟的音频素材。短样本图快,长样本图精,用户得按需取舍。

一个值得注意的细节是,模型内置了verbatim标签功能。这意味着,当语音内容里出现订单号、验证码或代码片段时,系统能确保逐字准确读出,而不是像普通TTS那样把数字读得含糊不清。对电商、客服和开发者工具场景来说,这个能力比音色更像不实用。