对着手机说一段话,屏幕上跳出一大段文字,读一遍却怎么都发不出手

打开网易新闻 查看精彩图片

  • 语气词、重复的词、说到一半改口的碎片,全被一字不落地记了下来。
  • 对方一眼就能看出这是语音转写。
  • 于是还得手动删一遍、补一遍标点,打字的功夫一点没省。

嘈杂的地方同样让人犯怵

  • 地铁里、饭馆里、街边,说的话常常被环境声盖掉一半,识别结果只能靠猜。
  • 带口音的普通话更麻烦,往往得先切换方言模式,忘了切就满屏错字。

9月23日,科大讯飞发布新一代语音识别大模型Spark-ASR-2.0

  • 并从9月24日起陆续上线讯飞输入法。
  • 官方对这次变化的概括是:从"一字不差"走向"出口成章"。
  • 过去的语音识别追求把说过的内容原样还原。
  • 新模型在保持识别准确率的同时,会结合上下文逻辑与语境理解,精简冗余表达、精修各类细节,让输出更连贯、语义更清晰。

具体改善集中在四个方面

打开网易新闻 查看精彩图片

一、是通用识别

  • 包含中英文混合、方言和专业术语。
  • 中英文夹杂的句子,以及医学、化学、科技领域里拗口的术语,识别表现都有提升。

二、是复杂声学场景

  • 包括高噪声、小音量、快语速和儿童语音。
  • 官方称,与当前业界最好水平相比,它在方言、高噪和小音量上拥有显著优势,主要任务效果均好于业界最优水平。

三、是上下文识别

  • 识别过程会融合此前的识别历史、修改记录和个人热词。
  • 用来消解语义歧义、易混淆发音和相似名词带来的偏差。

四、是文本流畅规范性

  • 语气词、犹豫时重复的词语、口头禅不再被原样记录。
  • 标点、数字、符号和单位也会按表达规范补全与转换。

用法上没有新增门槛

  • 在应用商店安装或更新讯飞输入法,进入输入界面点开麦克风,长按说话即可。
  • 遇到总被念错的人名、地名或产品名,可以把它加进讯飞输入法的个人语音词库。
  • 之后再听到同样的发音,就会优先按你设定的写法输出。

几类马上能派上用场的场景

打开网易新闻 查看精彩图片

  1. 走路、开车、做家务腾不出手的时候,一段话说完就是一段完整的话;
  2. 开会时把发言转成文字纪要,不必再逐句整理;
  3. 长辈不习惯拼音,用家乡话直接说也能成文;
  4. 长消息、长备忘录用语音起稿,省掉反复修改的时间。

方言这块是这轮最实用的部分

  • 官方介绍,Spark-ASR-2.0支持全国202个城市的方言免切换识别,不需要先选定语种再开口。

成本的账也值得提一句:

  • 在效果明显提升的同时,整体推理成本相比上一代只增加了10%。
  • 支撑这次升级的是不久前发布的语音基座大模型Spark-Audio-1.0-Preview,官方称团队在智能语音的多个技术方向上由此实现了突破。

技术上

  • 这一代采用非自回归与大模型增强自回归协同的架构,配合中英文混合文本与声学联合增强、动态上下文注入等做法。
  • 把识别的准确性、实时性、语言理解和文本规范放在一起优化。

除了输入法

  • 这套能力还会陆续落到讯飞AI眼镜、讯飞智能办公本、讯飞听见等产品上。
  • 面向开发者和企业,它也通过讯飞开放平台提供了API服务。

官方列出的下一步重点还有三项

  1. 在多人交谈与复杂噪声中锁定目标说话人。
  2. 用语音指令直接修改已识别的内容。
  3. 以及结合情感表达调整标点与措辞。

有三处边界需要先说清楚

打开网易新闻 查看精彩图片

一、是上线节奏

  • 官方措辞是"逐步上线",意味着分批放量,
  • 不同账号覆盖到的时间可能有先后,具体以App内实际表现为准。

二、是成绩口径

  • 上述改善均来自官方公布的测试与说明,属于模型层面的结果,不等同于每个人在App里拿到的实际效果。
  • 按官方说明,测试样本取自讯飞星火、讯飞听见、讯飞翻译机、讯飞输入法以及开放平台语音接口的真实请求并保持滚动更新,以词错误率、字错误率等指标衡量,数值越低越好。

三、是权益范围

  • 讯飞输入法个人版的打字、语音输入、智能纠错、云词库等核心功能不额外收费。
  • 部分皮肤、个性音效等增值内容需要单独订阅。

语音输入的竞争方向正在变化

  • 不再只比谁识别得准,而是比谁能直接给出一段可以发出去的文字。
  • 把润色这一步交给模型,等于把"说完还要改一遍"这个动作省掉了。

原创内容。如果你觉得有帮助,欢迎关注「AI工具跃迁」,每天发现一片AI新大陆~