为什么AI语音识别在闲聊时字字清晰,一到专业会议就频频出错?医生口述的“房颤消融术后”经常被转写成“房颤笑容术后”,程序员说的“Kubernetes”干脆变成一段乱码。7月31日,阿里巴巴发布Qwen-Audio-3.0-ASR-Flash,把“听懂专业词汇”这件事提升到了一个新高度。

新模型瞄准了此前语音识别最头疼的三个短板:上下文一致性、行业词识别和热词定制化。所谓上下文一致性,就是不再孤立地识别每个词,而是结合前后对话语境判断。比如单独听“字节”可能是数据单位,但出现在IT讨论里,模型就知道八成在说那家公司。行业词识别则是针对垂直领域建起一套专门的术语库;热词定制化,则允许使用者自己定义一批关键词,让识别引擎优先对齐这些词。这套组合拳打下来,模型还能直接对语音进行润色,输出结构化的文本——比如一份会议纪要,不再是原始逐字稿,而是带标题、分好点的成稿。

打开网易新闻 查看精彩图片

研究团队花了大量精力从医疗、IT编程、股票、社会名人等领域提取专业词汇,搭起了一个覆盖多行业的高质量词库。在最新的内部评测中,各行业的专业词“听中率”都明显蹿升,其中医疗场景更是突破了95.36%。这意味着,一段十分钟的查房录音里,药名、术式、检查项目的转写准确率已经远超过去。

在准确性这条线上,Qwen-Audio-ASR系列其实早有惊艳表现。此前的版本就在AI评测平台Artificial Analysis上,以1.7%的错字率拿下全球第一。要知道,在语音识别里,错字率每下降一个百分点,都需要在声学模型、语言模型上做大量调优,而1.7%已经逼近很多人工听写的准确度。这次3.0版本的升级,更多是把“听准”从常规对话推向了专业场合。

目前,Qwen-Audio-3.0-ASR系列已通过阿里云百炼平台开放调用,一次性给出三个版本:Flash版支持最长5分钟的语音识别,适合快速交互;Filetrans版用来处理离线文件转写,录音笔、课堂音频都能丢进去;Streaming版则是实时语音识别,追字幕、智能客服这些场景刚好匹配。三种接口覆盖了从短到长、从在线到离线的完整需求。

这背后是这类模型已经跑通了真正落地的场景。会议纪要整理不用再反反复复回听录音,实时字幕能跟上讲师偶尔蹦出的行话,教育录播里的专业表述被准确保留,智能客服也不再因为听错一个术语就给出岔子答案。从听懂日常到听懂专业,语音交互正在撕掉最后那层“半懂不懂”的夹层。