智东西作者   杨京丽编辑   李水青
打开网易新闻 查看精彩图片
智东西作者 杨京丽编辑 李水青

智东西9月24日报道,昨日,科大讯飞推出最新语音识别大模型Spark-ASR-2.0。该模型基于讯飞语音基座大模型Spark-Audio-1.0-Preview构建,重点提升通用识别、复杂声学场景识别、上下文识别和文本流畅规范性

打开网易新闻 查看精彩图片

值得注意的是,语音基座大模型Spark-Audio-1.0-Preview和语音识别模型Spark-ASR-2.0均基于全国产算力展开训练。讯飞正在以多年积累的智能语音技术和国产算力平台大模型训练经验为基础,持续推进语音基座模型、专用模型等技术迭代。

尽管大多数语音识别模型在日常使用中基本能够准确转写,但在嘈杂环境中输入、中英文混合输入,或者对专业会议进行转录时,仍可能出现错字、漏字;语气词、重复和临时改口,也常让转写结果需要二次整理。目前大部分语音识别模型的目标还停留在单纯的精准识别转写上。

为了验证Spark-ASR-2.0能否解决上述问题,智东西围绕通用识别、复杂声学场景识别、上下文识别、文本流畅规范性四个方向展开实测。

实测中,Spark-ASR-2.0整体识别表现较为稳定,能通过上下文修正部分歧义表达,减少口头语和重复内容,让语音转写结果更接近一段可以直接使用的文本。

Spark-ASR-2.0已陆续上线讯飞输入法,并且通过讯飞开放平台提供API服务,也开放了体验链接。后续还将逐步应用到讯飞AI眼镜、智能办公本和讯飞听见等产品上。

一、方言、芯片术语轻松识别,悄悄话也能听清

首先来看通用识别能力,我们用河南话对Spark-ASR-2.0进行了简单测试。

几乎在说完话的瞬间,模型就正确完成了语音识别。看来方言对于Spark-ASR-2.0来说,难度不大。据了解,Spark-ASR-2.0现已支持全国202种方言免切换识别

接下来,为了测试模型在中英文混合场景下,能否听得准,专业术语能否写得对,我们用一段芯片公司的业务介绍继续测试。

这段话包含RISC-V、TPU、VISA等多个英文缩写和芯片专业术语,句子较长,且中英文表达交织。

Spark-ASR-2.0完整识别整段内容,专业词汇也没有出错。对于科技媒体、技术会议等场景来说,这类专业术语的准确转写,能够减少后续人工校对成本

之后,我们又测试了模型在复杂声学场景的表现,这也是代表实际应用场景的关键维度。

我们先在地铁噪音场景下进行实测。

在背景噪声较为明显的情况下,模型能够区分环境声音和说话声音,识别出“一号线”、“东单”等关键信息,完整进行转写。

我们还测试了Spark-ASR-2.0的悄悄话识别能力

在刻意压低音量、使用气声说话的情况下,Spark-ASR-2.0仍然可以准确识别出完整内容。对于办公室等不方便大声说话的场景,低声说话,模型也能做到精确转写。

二、上下文纠错、口语规范成文,转写实现“零返工”

在不同场景下,准确识别语音只是第一步。相比逐字记录,用户更希望语音识别模型能够根据上下文调整,输出流畅、规范的文本。

于是,我们测试了模型的上下文识别能力

模型根据后文中“山峰的峰”,判断出“张三峰”的正确写法,后面“台风的风”也没有出现同音字错误的情况。

这个案例中,模型同样能够结合后文的解释理解语义,将易混淆的“灵”和“苓”调整为正确文字。

文本流畅性方面,我们模拟平常发信息时会出现的停顿、重复、改口等情况,观察模型的转写结果是否可以直接使用。

面对停顿、磕绊、改口,模型能够删去冗余内容,将会议时间修正为“8点半”,后面的邮箱也能够按照正确格式输出。

下面这个例子,我们进一步提高难度,加入了日期、取件码、快递单号等信息,看看模型能否规范输出。

测试结果中,取件码、快递单号和日期均准确识别,并且输出形式规整,没有因为连续数字、字母和符号混合,而出现遗漏或中断,转写结果可以直接使用

三、先快速识别、再重点纠错,推理成本较上代仅增10%

Spark-ASR-2.0的升级,建立在讯飞语音大模型持续演进的基础上。

9月16日,科大讯飞推出基于全国产算力训练的语音基座大模型Spark-Audio-1.0-Preview,支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等任务。

Spark-ASR-2.0是基于这一语音底座打造的语音识别大模型,同样基于全国产算力训练,进一步聚焦语音识别的准确性、实时性、语言理解和文本规范。

在去年科大讯飞全球1024开发者节上曾首发了非自回归语音识别大模型Spark-ASR-1.0,实现了推理效率的大幅提升,能够并行、一次性输出整个文本序列,效果相对提升16%,推理成本下降84%

从官方测试结果来看,Spark-ASR-2.0在语音识别核心场景上的效果较Spark-ASR-1.0进步明显。绝大多数场景的WER(词错误率)低于业界最优水平,在方言、高噪和小音量场景下表现最为突出。

打开网易新闻 查看精彩图片

不过,要同时兼顾识别效果、响应速度和推理成本并不容易。快速识别往往难以充分理解复杂语境,而强化语言理解又可能带来更高的时延和计算成本。

为解决这一问题,Spark-ASR-2.0延续了Spark-ASR-1.0非自回归识别能力,同时融合LLM增强的自回归识别能力

传统自回归模型需要按照文字顺序逐步生成,语言理解能力较强,但处理速度和计算成本相对较高;非自回归模型则可以并行完成整段语音的初步转写,响应更快,但面对复杂语境和易混淆表达时,修正能力有限。

Spark-ASR-2.0结合两种架构,先由非自回归模块快速生成整段语音的识别结果,再通过投机解码判断其中是否存在需要结合上下文进一步理解的内容,以及需要从哪里开始修正。

打开网易新闻 查看精彩图片

这种方式避免了对全文重新解码,在控制推理时延和计算成本的同时,提升了复杂语境、长尾表达和口语化内容的识别能力,整体推理成本较Spark-ASR-1.0仅增加10%

此外,针对中英文混合场景下数据匮乏的问题,模型通过补充英文专有词与热词,形成中英文混合文本数据,并结合语音特征和发音相似性进行联合训练,提升了对专业术语和不规范发音的识别能力

在上下文识别方面,Spark-ASR-2.0引入动态上下文注入机制,能够结合当前语音、个性化热词和用户历史修改,对人名、专业术语及易混淆表达进行综合判断,并从万级热词库中筛选相关候选词,在提升识别准确性的同时,减少无关信息干扰,基本不增加响应时延。

结语:基于长期技术积累,语音识别走向“流畅成文”

对语音识别而言,能把声音转换成文字早已不是终点,复杂环境下能否稳定转写、口语能否自动整理成文,正在成为新的竞争焦点。

科大讯飞从实际需求出发,关注降噪、专业术语、口头语、文本规范性等细节问题,把语音识别进一步推向“流畅成文”,让语音识别变成能够直接提升效率的生产力工具

这也是科大讯飞长期深耕智能语音技术的一次延续。尤其在语音识别领域,科大讯飞曾连续六届收获语音识别国际权威赛事CHiME冠军,面向“鸡尾酒会”问题不断挑战识别难题。

这也是科大讯飞长期深耕智能语音技术的一次延续。尤其在语音识别领域,科大讯飞曾连续六届收获语音识别国际权威赛事CHiME冠军,面向“鸡尾酒会”问题不断挑战识别难题。

2024年,科大讯飞作为第一完成单位的“多语种智能语音关键技术及产业化”项目获得国家科学技术进步奖一等奖。值得一提的是,讯飞过去积累的核心语音技术能力,始终围绕真实环境中的识别难题展开。

在大模型时代,讯飞将深厚的技术积淀与AI融合,持续探索语音大模型的更多可能。从近期推出语音基座模型,到昨日发布语音识别大模型,再到后续规划中的系列语音相关大模型,这一系列动作不仅展现了科大讯飞不断突破语音技术领域天花板的决心,也体现了持续推动技术应用落地、赋能产品业务的实践路径。