一个769M参数的模型,没有换架构,没有变大,只是换了一批训练数据,错误率从92.7%掉到了16.1%。
VoiceArena刚刚发布了Monsoon,一个覆盖50种语言、来自23个国家无脚本对话的语音数据集。Rohan Paul在X上转述这件事时给了一个判断:低资源ASR通常被当成模型问题,但Monsoon说明它其实是数据采集问题。
这个判断的分量,全压在那组数字上。
同一份权重,两种命运
测试场景是IndicVoices泰卢固语。开箱即用的Whisper Medium,语义词错率(WER)是92.7%——基本等于不能用。VoiceArena拿同一个769M检查点,在Monsoon上做微调,同一项测试里降到了16.1%。
76.6个百分点的差距,全部来自模型在微调阶段听到了什么。没有架构改动,没有更大的模型。
VoiceArena自己的测试里,这个成绩略微领先MAI-Transcribe-2和Gemini 3.1 Pro。注意这是它自己的测试口径,不是第三方横评。
92.7%这个数字值得多看一眼。它意味着模型几乎每句话都识别错了——不是偶尔听岔,是系统性失效。而失效的原因不在模型结构里,在它从没听过这类语音。
把噪声故意留下来
大多数语音数据管线会把噪声过滤掉。Monsoon反着来,故意保留。
短片段、嘈杂房间、困难的声学条件,这些都被留在训练分布里。而且这个混合比例不是随手抓的——VoiceArena按DNSMOS对片段做分层,让退化音频的占比成为数据的一个可控属性。
这个做法和直觉相反。常规思路是给模型喂干净数据,让它学得清楚。Monsoon的思路是让模型在训练阶段就习惯真实世界的脏——因为部署现场不会给它一间录音棚。
把噪声比例做成可控变量,而不是被动接受数据里有什么,这是数据工程层面的动作,不是模型层面的。
英语之外的长尾
VoiceArena在发布说明里写得很直接:语音识别不再有模型问题,它有的是数据问题。
最好的ASR系统在英语上已经接近人类水平。但一旦进入世界语言的长尾,尤其是真实场景下的语音,情况就变了。
Monsoon覆盖的50种语言、23个国家的无脚本对话,瞄准的正是这条长尾。无脚本意味着不是朗读文本,是自然说话——有停顿、有口音、有背景音。
这也解释了为什么92.7%和16.1%之间能差这么多。低资源语言的瓶颈,可能从来不在模型容量上。
一个还没答案的问题
Rohan Paul的帖子里有一条追问:性能差距里,有多少是数据稀缺造成的,有多少是语音本身的复杂性造成的?50种语言是不是都有一致的提升,还是有些仍然受限于模型?
这个问题目前没有公开答案。Monsoon给出的是一个方向性的证据——同一模型、同一权重、只换数据,效果差出76.6个百分点。
但50种语言内部的差异分布,以及数据稀缺和语音复杂性的权重划分,还需要更多测试才能说清。
可以确定的是:当一个769M的模型靠数据就能把错误率从92.7%压到16.1%,把低资源ASR继续当成模型问题来处理,方向可能从一开始就偏了。
热门跟贴