说出来你可能不信,我删掉了三个订阅服务,换了一个免费开源的 App。

这件事的起因是上周我在写一篇文章,手速跟不上脑速,试了各种方案——输入法语音、微信语音转文字、Otter——没有一款让我觉得"这就是我想要的"。

然后我在 GitHub Trending 上刷到了 FluidVoice

它是什么

FluidVoice 是一款 macOS 原生离线语音转文字应用,支持本地 AI 增强,开源免费(GPLv3),今天新增 365 颗 GitHub Star,总 Stars 突破 3,757

核心卖点只有一个:快 + 隐私 + 免费

安装方式也很简单:

brew install --cask fluidvoice

或者直接去 GitHub 下载最新 release。

解决什么问题

说白了,它解决了三个我一直没被很好满足的需求:

1. 延迟要低

很多语音工具等你说完才出文字,那种"等它反应过来"的感觉很打断思路。FluidVoice 用了 NVIDIA Parakeet 模型,基本是你话音刚落,字就出现了,延迟接近零。

2. 文字要准

苹果自带的语音输入对中文支持一言难尽,而 FluidVoice 支持 Whisper、Cohere、Nemotron Speech 等多个模型,你可以根据语言和准确度选最合适的。我测试了 Nemotron 3.5,中文识别率明显高于苹果原生。

3. 隐私要保

Otter 这些工具都要联网,语音数据经过服务器。FluidVoice 的" Fluid Intelligence" 是本地运行的 AI 增强模块,标点、大小写、上下文修正,全部在 Mac 本地完成,数据不离开机器。

值得关注的点

① 多模型自由切换——这是它的差异化核心

它不绑定任何一家语音服务商。你可以用苹果内置语音(零下载)、NVIDIA Parakeet(最低延迟)、Whisper(最广语言支持)、Cohere(最高精度),随时切换。这让它对全球用户都有吸引力,不只是英语市场。

② Command Mode + Write Mode = 全流程语音操控

这两个功能让我眼前一亮:

  • Command Mode:用语音控制 Mac——打开 App、触发 Shortcut、执行系统操作,完全不用手
  • Write Mode:选中一段文字,语音让它重写;或者在任意文本框里直接口述内容

配合全局热键,在任何 App 里随时唤起,这本质上是在做语音优先的工作流

③ 开源 + 本地优先,隐私护城河很深

在隐私焦虑越来越强的当下,一款数据不离开本机的 AI 工具,天然有信任优势。README 里甚至写了:"Warning: Based on early feedback, Fluid Intelligence may cause you to unsubscribe from other dictation apps and save money." —— 这句话很有个性,开发者敢这么说,说明产品真的有信心。

我的启发

工具类产品的核心竞争力,有时候不是功能多,而是"无感"——延迟低到让你忘了有这个东西存在。

FluidVoice 的 Parakeet 实现把延迟压缩到接近零,这个体验上的微小差距,恰恰是用户留存的关键。它不跟你比模型参数、API 能力,它比的是"说话到看到字的瞬间"那个体验。

对于我们做独立开发的人来说,FluidVoice 的思路很值得借鉴:与其做一个功能堆砌的大杂烩,不如在一个高频痛点上做到极致,让用户产生"离不开"的感觉。