语音转写工具输出的原始文本,往往夹杂着大量“嗯”“啊”之类的语气词,句子说到一半又改口,标点符号缺失,数字和日期也全是口语化表达。这类文本直接用于会议纪要、医疗记录或法律文档,几乎没法看。Superwhisper 最近发布的开源模型 S1-mini,正是为了解决这个问题而生。

S1-mini 是一个 0.6B 参数的文本规范化模型,它不负责语音识别,也不做对话生成,而是专门处理语音识别系统输出的原始转写文本。模型会把“嗯”“那个”这类填充词删掉,把说话人改口的内容修正为最终表达的意思,补上标点和大小写,同时把口语化的数字、日期、货币和邮箱地址转换成书面写法。比如你说“support at superwhisper dot com”,模型会直接输出 [email protected]

模型怎么做到这件事

S1-mini 基于 Qwen/Qwen3-0.6B 微调而来,拥有 5.96 亿独立参数(非嵌入参数 0.44B),共 28 层,16 个查询头和 8 个键值头,采用 GQA 架构,权重为 BF16 精度。Hugging Face 页面显示的 0.8B 参数是因为绑定的嵌入层被重复计算,模型卡中对此有明确说明。发布 v1 版本目前仅支持英文,推荐输入长度约为 1000 tokens。

模型的控制方式非常简洁,通过一条固定格式的控制行来实现。在系统提示词之后,输入格式为:[Styling: 风格] [Structure: 结构] [Context: 上下文],后面跟上原始转写文本。Styling 轴支持 casual、semi-casual、semi-formal、formal 四种风格;Structure 轴支持 prose 和 lists 两种结构;Context 轴支持 general 和 email 两种场景。三个轴相互独立,所有组合都经过训练。

部署门槛有多低

S1-mini 以 Apache 2.0 许可证发布在 Hugging Face 上,附带命名条款。Q4_K_M 量化版本的 GGUF 文件只有 462MB,在笔记本电脑的 CPU 上就能运行。独立开发者可以把它打包进桌面应用,企业也能部署在 VPC 内部,确保音频转写数据不出内网。

在 Superwhisper 公布的测试数据中,S1-mini 在 7519 个保留样本上取得了 94.8% 的 token 准确率,测试基于量化版本采用贪婪解码方式完成。

适合用在哪些场景

从应用场景来看,S1-mini 适合放在任何需要把原始语音识别输出变成可读文本的流程中。医疗和临床文档、法律文书、金融服务、客户支持、开发者工具、无障碍辅助和实时字幕都是典型的应用领域。具体到产品层面,口述笔记应用、会议纪要工具、实时字幕系统、语音驱动编辑器、语音录入 CRM 系统,以及任何需要处理 ASR 原始输出的管道,都可以直接接入。

需要说明的是,S1-Voice 和 S1-Language 是 Superwhisper 托管的云服务,只能调用,不能自行部署。真正开放权重、可以本地运行的只有 S1-mini 这一个模型。

和传统方案的区别

过去处理语音转写文本的脏数据,通常靠正则表达式匹配加人工校对,遇到口语化表达和改口场景效果有限。S1-mini 的做法是把文本规范化本身变成一个模型任务,通过控制行让用户按需调整输出风格,而不是固定一套规则。这种设计让同一个模型既能输出正式的会议纪要,也能生成相对随意的聊天记录格式。

对于正在搭建语音转写管线的开发者来说,S1-mini 提供了一个轻量级的中间层方案。462MB 的体积意味着它几乎不占用太多资源,却能把 ASR 输出的原始文本整理成可以直接进入下游系统的干净文本。这在本地部署和隐私敏感场景下,价值尤其明显。