语音合成还能更有“人味”吗?阿里千问的最新模型打算用抽气、轻笑声来回答。7月20日,阿里千问正式发布语音合成大模型Qwen‑Audio‑3.0‑TTS,一次性放出面向实时交互的Flash版和注重高音质的Plus版。更引人注意的是,Plus版刚登场就登上了第三方权威评测平台Artificial Analysis的榜首。
Flash版的核心指标很直白——首包延时压到300毫秒级别,适合需要即时反馈的对话场景。而Plus版显然冲着品质天花板去,不仅在榜单上拿下了第一名,还把音频输出规格从常见的24KHz直接拉到48KHz。用官方的话说,这就好比从电话和普通语音助手的声音,一步跳到录音棚或影视配音的清晰度,而且单次语音合成最长能到3分钟。
打开网易新闻 查看精彩图片
让合成语音从“能说话”走向“会表达”的关键,藏在一套细粒度标签系统里。用户可以在文本中直接嵌入诸如[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)等标记,精准控制语气、情绪乃至呼吸类细节。这相当于给文本加了一层表演指令,而不只是把字念出来。
多语种和多方言的覆盖也一次性铺开。Plus版专项优化了中、英、日、韩、德等16种语言,并新增阿拉伯语、越南语、马来语、菲律宾语;方言方面一口气支持广东话、重庆话、东北话、陕西话、上海话、四川话、云南话等20种。配合即将陆续上架的精品音色库,包括指令风格音色、细粒度控制音色以及14种以上小语种音色,用户拿到的是一个开箱即用的语音合成工具箱,不用再自己折腾复杂的声学调参。
目前模型已全面开放,可在阿里云百炼平台直接调用。从实时对话到高品质配音,从方言客服到多语种内容生产,这款即登顶的大模型正在把“能说话”的门槛,悄悄拉高到“会表达”的维度。
热门跟贴