今天我们不急着介绍模型,先来玩个游戏。

下面有几段语音,请你挑战一下听写,并预估下会有多少的准确率。

觉得小意思?还是有点悬?

我们用腾讯混元今天发布的最新语音识别模型Hy ASR 3.0 preview挑战了一下,结果是这样的:

腾讯混元Hy ASR 3.0 preview发布!能理解上下文的语音识别来了
打开网易新闻 查看更多视频
腾讯混元Hy ASR 3.0 preview发布!能理解上下文的语音识别来了
腾讯混元Hy ASR 3.0 preview发布!能理解上下文的语音识别来了
打开网易新闻 查看更多视频
腾讯混元Hy ASR 3.0 preview发布!能理解上下文的语音识别来了
腾讯混元Hy ASR 3.0 preview发布!能理解上下文的语音识别来了
打开网易新闻 查看更多视频
腾讯混元Hy ASR 3.0 preview发布!能理解上下文的语音识别来了
腾讯混元Hy ASR 3.0 preview发布!能理解上下文的语音识别来了
打开网易新闻 查看更多视频
腾讯混元Hy ASR 3.0 preview发布!能理解上下文的语音识别来了

无论是方言、中英文混说、同音词、专业术语识别,还是嘈杂环境中的转写,这几道题Hy ASR 3.0 preview都做到了完全精准识别。

而这些结果背后,是Hy ASR 3.0 preview的语音识别全面升级。基于最新一代大语言模型Hy3的语言理解能力,以及融合了高精度语音识别与深度语义理解能力,它的目标很简单:让语音识别不再只是听清,而是真正听懂。

通过先理解你的语境和意图,再把准确的文字直接给到你。从“逐字转写、单点优化”演进为“理解语境、兼容场景、一键直出”。

//能理解上下文的语音识别

能理解上下文的语音识别,带来的,是在通用识别、上下文感知、多场景鲁棒性(即在各种不理想条件下保持准确识别的能力,如嘈杂环境)以及方言覆盖等核心维度识别能力的全面提升。

-通用识别:不再需要标准普通话

以前,每次使用语音识别都要认真吐字,生怕普通话不标准识别不准确。

现在,即使你用方言来一段绕口令,或者来一段中英夹杂的rap,Hy ASR 3.0 preview也完全能接住招。

Hy ASR 3.0 preview的方言识别覆盖粤语、吴语等10大方言片区和20余个二级小片区。在开源评测集中,Hy ASR 3.0 preview 在多语种的WER(Word Error Rate, 词错误率)上控制在3%左右,其中中文普通话WER 3.34%、英语WER 2.62%、粤语WER 3.12%,整体处于行业领先水平。

你可以说得快一点、随意一点,它都能跟得上。

-上下文理解:同音词不再是坑

期中考试还是期终考试?致癌物质还是治癌物质?

这些同音词单靠声学信号很难区分,但通过上下文语义判断,问题就迎刃而解了。

Hy ASR 3.0 preview结合Hy3的语言理解能力,结合上下文Context精准捕捉用户语境,消除歧义,智能纠错同音词。这在转写难度较大的会议纪要、访谈转写等长音频场景中却尤为有优势:越说越懂你。

-行业术语识别:你的专属百事通

金融报告里的“EBITDA”、化学研究里的的“核磁共振氢谱”、游戏直播里的“打野蓝开”......每个领域的术语,Hy ASR 3.0 preview都是行家。

此外,针对不同企业和业务的特殊场景和定制化需求,Hy ASR 3.0 preview还支持热词注入增强,帮助模型快速识别品牌产品名称、人名及行业术语。对于企业来说,可以大幅降低业务接入和持续维护的成本。

-复杂场景识别:既能应对高噪,又能听清耳语

真实世界的语音不会总是安静的录音棚。工厂车间、街道、篮球场......这些场景下,声学信号的退化是几何级的。

Hy ASR 3.0 preview面向高噪、耳语、悄悄话等多种声学场景下进行专项优化,既能应对地铁站、KTV等环境的嘈杂,也能听清咖啡厅、办公室、图书馆里的那些悄悄话。

//架构、数据、后训练三重驱动

Hy ASR 3.0 preview的能力提升并非来自单一模块的补丁式优化,而是模型架构、数据Scaling与后训练优化共同作用的结果。

模型架构层面:采用兼顾效率与性能的MoE架构,基座模型升级至Hy3。在语音侧,混元团队自研了无监督语音Encoder,通过数千万小时级的无监督语音数据训练,使其能够从各种复杂音频中提取高质量的声学表征。Encoder负责听得好,Hy3负责理解对。

数据Scaling层面:团队对语音 Encoder 和大语言模型进行联合训练,引入数千万小时级、多来源的语音数据,持续增强模型的语音建模与理解能力。并通过多阶段能力注入,使其具备上下文感知、复杂场景适应和方言识别等能力。

后训练优化上:围绕通用识别、上下文理解和复杂场景鲁棒性,构建了高质量的 SFT recipe,覆盖上下文Context、专业名词、不同声学环境以及多样人群语音等。团队还进一步引入多阶段强化学习,分别针对通用转写准确性、Any-context 上下文能力和复杂长尾场景进行优化,降低模型在复杂声学环境中的误识别和漏识别问题。

打开网易新闻 查看精彩图片

//腾讯云、元宝已同步上线

元宝深度参与Hy ASR 3.0 preview的研发,目前已完成首发上线,用户打开元宝,按住对话框,讲方言、说术语、在嘈杂或耳语场景里随口一问,都能听得更准、识别更稳,还能结合上下文自动纠正同音词。WorkBuddy等产品也在陆续接入中。

Hy ASR 3.0 preview也已上线腾讯云官网对外提供 API 服务,支持智能客服、内容理解、语音搜索等应用场景,每一处需要“把说的话变成文字”的地方,都可以用 Hy ASR 3.0 preview让识别更精准高效,欢迎接入反馈。