前面在微博上和朋友聊到语音输入法的事情,其实我算是国内最早一批尝试语音输入法的用户了,算是比较真切见证了语音输入从鸡肋功能,蜕变为AI时代高效交互方式的全过程。
大约是90年代末(具体时间记不清了),我就接触过IBM ViaVoice这款初代语音输入工具——应该是同学家里买电脑时送的软件吧!(图1)现在回想起来,当时的使用体验堪称繁琐低效。首先,它先需要用户花费大量时间朗读专属文本训练口音(从几十句到上百句不等),适配个人发声习惯;其次,使用时全程需要手动口述逗号、句号、换行等标点符号(你可以想象一下,我说完一句话后还要自己喊出‘句号’的尴尬感);第三,即便完成繁琐的训练,实际的识别准确率依旧很差,错字漏字频发,修改成本极高。所以在尝试了一段时间后,最终我只能彻底放弃语音输入;
IBM ViaVoice
移动互联网兴起后,讯飞输入法成为语音输入的新选择,我也第一时间更换体验(2011年末,图2)。相较于老旧的IBM ViaVoice,它的云端识别能力确实有了质的提升,无需复杂的口音训练,开箱即用,适配手机移动端的输入场景。但现在回想起来,早期讯飞的短板依旧十分明显,当时的语音识别仅停留在机械转录层面,没有智能优化能力。日常说话的“嗯、啊”等语气口头禅会被完整录入,无法自动过滤,同时也会出现断句混乱、字词识别偏差的问题。
讯飞语音输入法
所以,每次语音输入完成后,我还是需要花费一定的时间逐字删除语气词、修正错字、调整语句语序。一番修整下来,整体耗费的时间和精力,似乎也没有比直接手打键盘快多少。所以最终我再次回归了传统打字模式,语音输入只作为一个不方便打字时的辅助。
直到AI大模型普及,我开始使用豆包输入法的语音输入功能,才真正颠覆了我对语音输入的固有认知(图3)。
豆包输入法
毕竟,当下早已进入AI交互时代,我已经不再只是简单打字记录文字,而是日常较高频地和AI对话、打磨文案、梳理思路、生成内容,持续的双向沟通成为常态。在这种场景下,传统打字的效率短板被无限放大——人的思维连贯且飞速,即使我的打字速度飞快,但依旧远远跟不上大脑的构思节奏。如果因为打字速度而频繁打断思考逻辑,那么我和AI的交互就会变得割裂又低效。
好在依托AI算力加持,如今的语音识别准确率大幅提升,完美适配高频AI交互需求,绝大多数场景下几乎无需纠错。而且系统可以智能过滤我的“嗯”、“啊”、“这”之类的口语语气词、自动精准断句、匹配标点符号,输出的文本整洁通顺,仅需简单微调即可使用。每一次当我看到输入法“明明出了一个同音的错别字,但在完成输入时又被ai自动校正成正确文字”时,那确实是有些震撼的!所以,我目前在手机上已经以语音输入为主要输入方式,仅在公共场合、深夜等不便出声的场景,我才切回到传统的九宫格输入。
千问输入法
不过,这篇文章并不是豆包输入法的宣传软文,因为它目前除了手机端外仅有Mac而没有WinPC版本(真不知道他们在磨蹭什么)。而豆包的竞争对手千问也已经推出了自家的输入法,且似乎还有更强大的ai排版整理功能(图4)。嗯,那就看他俩谁先出WinPC版本了,反正目前我可没有什么AI忠诚度,谁好用我立马就换谁!(笑)
热门跟贴