你想过吗?对着空气轻声说几句话,文字就能出现在手机上。这不再是科幻。过去几个月,我和电脑说话的次数比过去几年加起来都多。大型语言模型的浪潮带来了一项被严重低估的进步——听写技术。哪怕是最快、最便宜的模型,现在都能很准确地听懂并处理语音。我试过 WisprFlow、Monologue、Spokenly、Handy 等一大堆工具,它们都能快速帮忙写邮件、回 Slack 消息。这些工具有时会犯一个毛病:把所有内容都格式化得过于正式,还特别喜欢给短信末尾加上句号(活像一个不懂表情的机器人),但它们正在改。

不过,真正让我相信“对着电脑说话”就是未来交互方式的,是 Mina Fahmi 前不久给我做的一次演示。Fahmi 是 Sandbar 公司的 CEO,他们正在造一款叫 Stream 的智能戒指,计划今年晚些时候出货。在 Sandbar 纽约办公室的会议室里,Fahmi 给我展示了这款戒指的功能,最新的一个是:向所有设备进行听写转录。他打开 iPhone 上的便签,把戒指举到嘴边,拇指按住触控板,小声嘟囔了几秒钟。话音刚落,两行完整的、完全正确的句子就出现在便签里。

打开网易新闻 查看精彩图片

Stream 这个戒指,本质上就是麦克风、电池和蓝牙连接的组合。你现在可以用这句话描述一大堆 AI 硬件,因为似乎每家公司都想卖你一个能录制对话和会议、然后提取摘要和待办事项的东西。Plaud、Pocket、FoCase、Mobvoi 等等,都在卖这类便携录音器——如果能磁吸在手机背面录通话,那就是加分项。

Fahmi 和 Sandbar 想做的却不太一样。Stream 是一个更“内向”的设备,它专注于捕捉你自己的声音,而不是录下周围所有人的。另一个承诺的功能是低语模式——Fahmi 当时对着戒指说话声音小到我完全听不清,但戒指依然完成了转录。至少 Fahmi 是这么说的。他告诉我,这个想法源于他喜欢走路思考,每次冒出点子或者想叫 AI 助理干活时,都要掏出手机,实在太烦了。

根据规划,Stream 戒指只做三件事:启动与 AI 助理的对话、记笔记、听写文字。目前这些功能大多要在 Stream 的配套 App 里完成,但这并不是理想的长期方案,也不是 Sandbar 的最终路线。像这样的硬件,最终应该连接到所有设备,成为一个安静的入口,而不是又一个新的 App 孤岛。