音频转录技术最近进步飞快,我已经开始琢磨着在所有能用得上的地方都用起来。

既然决定要用App,我直接打开了手机自带的应用来干活。手机里本来就有现成的工具,而且很可能比第三方做得更靠谱,我就不太乐意再去翻找别的了。

打开网易新闻 查看精彩图片

不过,如果你打算经常使用这类应用,那你肯定希望选中那个能给你最清晰、最准确、最容易调取结果的。我专门测试了三星录音机和Google Recorder这两款应用,想看看谁更能满足我的转录需求。先剧透一下:这其实是个相当纠结的抉择。

录音转录到底能用来干嘛?用途比我原先想的要多。说实话,我之前真没觉得这功能有多大用,直到跟朋友们和同事聊过之后,我才意识到大家用得还挺花。最显而易见的场景当然是工作会议或者上课。我的线上会议通常有AI笔记工具来搞定,我个人觉得那些工具表现还可以,但到了线下会议,情况就容易变得一团糟。我很难一边高效记笔记,一边还要全身心参与讨论。偶尔我们也会安排专人做会议记录,但他们往往抓不住所有要点,或者因为缺乏背景信息而漏掉关键内容。这时候,录音转录就成了一个很棒的选择,我可以让手机录下来,事后再翻看笔记,把可能遗漏的部分全补上。

还有几个朋友提到,他们会征得医生同意后在就诊时录音。我觉得这用途太绝了。很多医生时间紧张,说话速度很快,或者会用到一些你当下反应不过来的术语。像我第二天回想护理要点时,总有好几处会自我怀疑,拿不准当时医生到底嘱咐了什么。最后,这对那些有特殊状况、导致理解或记忆信息存在困难的人群也特别友好。无论是听力障碍、多动症还是焦虑症,很多情况下,能有一份文字稿留着之后慢慢看,都会带来实打实的帮助。我觉得这对那些不太能流利听懂英语对话的人也是个大福音。

光看第一眼,这两款应用真分不出谁更好。设计和手感上的比较,最后都得落到一些特别细微的挑剔上。从视觉上看,三星和谷歌的录音App都走简洁清爽路线。我觉得两者的界面都挺直观的,录音键都摆在显眼位置。不过,当我把测试录音都录完之后,谷歌应用立刻就把转写好的文字显示了出来,而三星这边则需要我去点一个大大的“转写”按钮。

在三星的应用里,我很喜欢屏幕底部的播放选项:跳过静音、重复和播放速度调节。不过,我得提一下,它的摘要功能,还有像音频裁剪之类的其他工具,都被藏在了右上角的三点菜单以及那个看起来像闪光的图标里面。

在转录正文里,说话人标签被处理得明明白白。我喜欢它在播放音频时能高亮显示对应的文字,这跟在Spotify上跟着歌词听歌的感觉差不多,能让我跟上进度。在开始真正的测试之前,我还想插一句,谷歌在切换设备时同步录音文件这一点做得非常顺畅,这也算是它的一项优势。

真正的较量,当然得看说话人识别能力。我们录了一段三个人彼此随意打断的对话,来给这两款应用上上强度。在三星录音机上,我把音频导入后,应用给出了警告:“说话人标签无法在设备上生成。”它倒是给了个变通方案,说我可以上传到三星云,在那里用更强大的服务器端模型来生成说话人标签。我觉得这很烦人。如果是超级敏感的谈话内容,我其实不太想把文件上传到云端。尽管三星的语音转文字引擎在准确性方面表现稳健,但这个流程未免太让人心累了。

等我在三星云上处理完之后,我可以下载带有说话人标签的文本——但前提是,我得手动把这份文字稿复制到剪贴板,再粘贴到我去的地方。可在Google Recorder里,同样这段音频,说话人标签直接就在我手机上生成了,完全离线运行。这还是我用了几年的老款手机,不是什么最新的旗舰机。老实讲,考虑到谷歌和三星在AI和软件功能上的紧密合作,发现这种差距实在有点说不过去。转录的准确度,两个应用都相当高,可差别在于效率和自由度。

假如你需要转录的内容是个人性质的,或者是敏感的商业对话,你很可能不想让任何数据离开你的设备。谷歌在保护隐私的设备端处理能力上,给出了一个更让人安心的选项。

此外,三星这边多了个额外的整理步骤,体验上就差点意思。Google Recorder转写的文字稿直接就能用,而三星要求你决定是上传到云端换取更多的功能,还是留在本地但接受功能被阉割。而另一项AI摘要功能,也需要你主动从菜单里打开它。我发现在三星设备上用这款应用,整体上就给人一种这里藏那里掖的感觉。

哪怕像我这样需要用到它的人,也可能很久都不知道这些功能的存在。Google Recorder在转录完之后,直接把摘要标签页亮出来,无需额外操作。

如果你选择用三星录音机,那就做好准备应付一套有点繁琐的流程,尤其是一旦你的首要刚需是清晰识别出谁说了什么。对于那些有听力障碍、或者正在处理艰难的医疗对话、又或是想在课堂讨论里跟上节奏的用户来说,这就是一个没法忽略的坎。