原本只是“能说话”的语音助手,现在开始学着“表达”。通义实验室扔出了Qwen-Audio-3.0-TTS实时语音合成模型,名字很长,但意思很直接:机器念稿的时代结束了。
这次发布分了Flash和Plus两个版本,核心突破在于用自然语言指令直接控制语音输出。你不用再像调试老式收音机那样去调参数,告诉它“读得悲伤一点”“换成四川话”“这段用新闻播报的语气”,它能听懂,并且照做。
打开网易新闻 查看精彩图片
更关键的是多语种和方言支持。以前这类模型要么只认普通话,要么英文输出带着一股塑料味。Qwen-Audio-3.0-TTS试着把中英混合、方言切换这些真实场景的坑填上。如果实测效果稳定,那些靠人工标注情绪标签的旧方案,大概率要被掀桌子了。
从“能说话”到“会表达”,区别在于前者只是声波合成,后者开始涉及语气、情绪、语境适配。通义实验室这步棋,瞄准的是语音交互从工具性向人格化的过渡。话说回来,模型归模型,最终落到产品里能不能让用户觉得“这声音像个人”,还得看各家的工程落地能力。
热门跟贴