9月23日,千问发布Qwen-Audio-3.1系列语音大模型,共5款,升级语音识别(ASR)、语音合成(TTS)、实时语音交互(Realtime)三类模型,并推出ASR-Next与TTS-Next。

Qwen-Audio全线语音模型价格同步下调,其中语音合成(TTS)降价约70%,实时语音交互(Realtime)降幅约85%,语音识别(ASR)降幅达95%。

在2026云栖大会上,上述模型的API服务已上架千问AI平台,并共同构成覆盖“理解—生成—交互—创作”的完整音频能力栈。

Qwen-Audio-3.1-ASR增强了多语种、方言识别和上下文理解,新增原生转写润色,可自动去除语气词与重复表达并重组语义;Qwen-Audio-3.1-Realtime可主动调用Agent工具完成任务。

在公开方言测试集KeSpeech和WSYue上,Qwen-Audio-3.1-ASR的11个子集中有6个优于Doubao-ASR和Tencent Hy-ASR-3.0-preview两款开源模型,平均字错误率(CER)仅为4.55%。

市场有风险,投资需谨慎。本文为AI基于第三方数据生成,仅供参考,不构成个人投资建议。

本文源自:市场资讯

作者:行舟