智通财经APP获悉,7月31日,阿里巴巴(09988)正式发布新一代语音识别大模型Qwen-Audio-3.0-ASR-Flash。据介绍,该模型主要在上下文一致性、行业词识别和热词定制化三个维度做了系统性的优化,同时具备语音润色能力,可直接输出结构化文本。

目前,Qwen-Audio-ASR-Flash系列已经在会议纪要整理、实时字幕、教育录播、智能客服等场景里得到广泛验证,曾在全球权威AI评测平台Artificial Analysis上,以1.7%的错字率拿下全球第一。对语音识别来说,能否准确识别专业词汇,往往是其真正在行业里用起来的关键。

Qwen-Audio-3.0-ASR现已通过阿里云百炼平台开放调用,提供三个版本:Qwen-Audio-3.0-ASR-Flash(语音识别,最长5分钟)、Qwen-Audio-3.0-ASR-Filetrans(离线文件转写)和Qwen-Audio-3.0-ASR-Streaming(实时语音识别)。

上下文不“断片”

在会议、访谈、课程、直播这类长音频里,很多专业术语、英文词汇等,光靠当下这几秒的声音其实判断不准——同一个发音可能对应十几个同音词,模型必须记得前面说过什么,才能在这一段里识别准确。

Qwen-Audio-3.0-ASR-Flash新增了这项能力:在转写当前这段语音时,它能参考近期已经识别出的内容,顺着同一话题里的关键词和语义往下听,从而减少同音词误判,把术语、中英文混说这些容易出错的地方听得更准。哪怕是一场好几个小时的会议录音,同一位发言人的名字、同一个技术概念,也不会因为跨了好几段就被忘掉或认错。更方便的是,这些“记忆”直接来自音频本身,会随对话自动更新。

听得准行业词

“记得住上下文”解决了“说过的词不再认错”的问题;但还有很多专业词,整场对话里可能只出现一次,模型得在“从没见过”的情况下也能一次就听对。传统做法通常靠人工维护词表,费时费力;Qwen-Audio-3.0-ASR-Flash把这件事变成了模型自身的能力,不用人一个个去配,也能在真实业务里越用越准。

具体来说,研究团队持续从医疗、IT编程、股票、社会名人等领域里挖掘专业词汇,建成了覆盖多行业的高质量词库,加强模型对专业术语和冷门词的识别。在最新的行业词汇内部评测中,新模型对各行业专业词的"听中率"都有明显提升,其中医疗场景更是突破了95.36%。

热词加多也不乱

行业词库覆盖的是通用场景,但每家企业还有自己的专属叫法。让模型认得这些词,是语音识别落地企业的刚需。传统做法长期有个两难:热词加得越多,误触发也越多,识别结果反而被带偏了。

Qwen-Audio-3.0-ASR-Flash全新升级即时热词定制能力——在传入热词的情况下,热词“听中率”在所有测试集都达到90%以上,多数场景更是突破99%,不再是“提了这项、掉了那项”。对用户来说,这意味着你可以随时把最新的品牌名、人名、术语配成专属热词,实时融进识别里,不用等模型更新,就能精准命中业务里的每一个关键词。

边识别边润色

口语里的“那个”“嗯”这类口头禅会被直接去掉;说话时的自我纠正,比如“我们下周三评审,不对,是周四”,只保留最后的意思;结结巴巴的重复、零散的口述,也会被整理成简洁、书面的表达。这些活都由ASR模型在识别环节一步做完,不用再叫一个下游的文本大模型来帮忙。

在评测中,它去口头禅、去重复后的可读性和忠实度,和“先识别 + 再用Qwen3.6-Plus润色”的两步走方案基本打平(比如所有子集的可读性平均分从没润色时的2.55提升到3.43,优秀可读率从30.75%提升到59.27%)。

一套模型听懂30种语言

如今越来越多企业走向海外,语音识别要面对的早就不只是中文和英文了:跨境客服要回应不同国家和地区的咨询,国际会议上经常几种语言来回说,海外的音视频内容也在不断增多。相比资料丰富的主流语言,小语种普遍有个难题——训练素材少、口音差异大、口语表达也更随意,往往是最容易听错的环节。

Qwen-Audio-3.0-ASR-Flash把多语种识别能力都集成在同一套模型里:从中文、日语、韩语,到泰语、越南语、印尼语、马来语等东南亚语言,再到印地语、阿拉伯语,以及英语、法语、德语、西班牙语、葡萄牙语、俄语等欧洲主流语言,都能直接识别,不用针对不同市场频繁换模型。

用的时候,只要告诉模型这场会议可能涉及哪几种语言,它就会自动开启“多语言混合识别”——以中文、英文、日语为主语言,自由搭配其他小语种,轻松应对“中文+英文+日语”“英文+印尼语”这类跨国会议、多语客服的场景。在七个语种的评测中,它的平均语义错误率仅17.09%,优于Azure、ElevenLabs Scribe v2、Gemini 3.0 Flash以及上一代模型。

低延迟场景也听得准

Qwen-Audio-3.0-ASR-Streaming——面向客服通话、会议实时转写、直播字幕这类对速度要求很高的场景,在保证“几乎不卡顿”地实时出字的同时,把复杂工业场景下的识别准确率也一起拉了上来。

它在保持理论出字延迟300毫秒的同时,进一步提升了复杂工业场景下的识别准确率:中文工业场景的平均错字率仅7.8%,明显领先同类;英文工业场景为11.52%,同样优于其他模型。

从记住上下文,到听准行业词、自由定制热词,再到一步输出干净文字,Qwen-Audio-3.0-ASR-Flash想做的就是在复杂的对话里持续听准、在专业的领域里精准听对、在最终输出时润色到位。目前它已在阿里云百炼平台开放调用,也期待看到大家在会议、教育、客服、出海等真实场景里把它用起来。