阿里巴巴最新推出的通义千问音频模型Qwen-Audio-3.0-TTS-Plus,在Artificial Analysis的Speech Arena排行榜上以1236的ELO评分,力压Simba 3.2的1234分摘下榜首,Gemini 3.1 Flash TTS和Sonic 3.5分别以1214分和1207分落后。该模型提供两个版本:Flash版延迟约300毫秒,主打实时交互;Plus版则专攻高品质语音输出。它支持包括他加禄语、马来语泰语、越南语在内的16种语言及多种汉语方言,用户可直接用自然语言指导说话风格,或插入“[angry]”“[giggles]”等标签添加非语言提示。阿里还表示,在声音克隆时,该模型对嘈杂或回声重的参考录音比以往版本更稳健。然而其输出速度仅每秒16个字符,远逊于Sonic 3.5的120字/秒和Simba 3.2的30.2字/秒,成为明显短板。该服务通过阿里云模型工作室定价为每百万字符27.60美元。质量与速度的巨大落差,或许正是开发者需要权衡的核心冲突。

打开网易新闻 查看精彩图片