近几年来,随着智能语音技术的发展,语音的速度和识别率显著优于拼音手写,因此语音输入成为手机输入法的标配。然而语音输入叫好不叫座,多数因为在一些场合使用不便。例如,安静的场合语音输入担心会暴露隐私、影响他人;嘈杂的场合,语音输入的识别效果没有那么好;另外语音输入难以保持连续说话,参杂“嗯、啊、额……”识别出来需要修改。

针对这些个用户痛点,市面上是否有输入法颠覆这种传统认知呢?我想是有的。但凡说到语音输入,首先想到讯飞输入法。2017年讯飞输入法不仅把语音识别准确率提升到98%这个行业新高度,还带了一些创新让我印象深刻,因为这直接事关用户体验。

1、耳语输入

“大声说话是本能,小声说话是素质。”大概文明程度愈高,说话愈不以声大见长。这是为何在公共场合,绝大多数用户倾向于键盘打字而非语音输入。

而讯飞输入法语音输入功能解决了这个问题。通过全新“耳语输入”精准识别“悄悄话”,甚至20分贝的声音也听得清,一举化解地铁、公交车上打字不便,低声说话不怕泄露隐私;在电影院、图书馆轻声回复不影响他人;会议、讲座中突遇紧急情况,小声答复不误事。

2、抗噪语音

讯飞输入法还有一个黑科技,将噪音鲁棒性(即抗变换性)工作做到语音识别系统之内。在语音识别系统识别时,将待识别语音处理成与模型训练时相一致的语音特征。

简单理解为,输入法的实时语音录音先通过环境嗅探区分出噪音环境的分类(车内外噪音、会场音响噪音、地铁噪音等),分领域噪音补偿可基于环境嗅探的知识分辨出各种不同领域,自动采用不同的算法去除带噪语音中的噪音,从而达到提高信噪比的效果;而混合训练技术则可以弥补去噪后语音所产生的同真实安静语音的语谱差异,再基于海量覆盖各种噪音的真实数据,综合形成业界最优异的抗噪解决方案,从而在嘈杂环境甚至不同噪音下都能保持高效准确的语音输入。

3、超长语音输入

大多数语音输入是“限时长”的,用起来不尽兴。点开麦克风说话,说完还要继续点。说话中很多时候需要思考,不经意间加入许多无效的口语。近日,讯飞输入法成功破解这一难题。深度整合业内领先的循环神经网络技术(RNN)用来进行语音的端点检测,在语音输入过程中能够自动过滤无效的语音信息,实时跟进说话人语速,解决持续的音频流拾取过程中人声检测、准确断句及识别率的问题。相比传统“限时长”的语音输入,超长语音输入点击一次麦克风,就能够连续语音输入,大段文字快速上屏,想说多久就说多久。

在开启超长语音输入,说的磕磕绊绊有很多语气词,经过讯飞输入法口语顺滑的优化,智能判断减少语气词的干扰。碰到大脑空白、说话思路不连续甚至中途停止说话时,讯飞输入法监测语音输入音量,进入待识别状态,当再次说话时再连续语音输入。

说在最后:

基于以上创新,可以预见语音输入将变得更简单可依赖,人们可以不用考虑怎么说才能更好的输出文字,而是我想怎么说就怎么说,形成用户习惯是迟早的事。