做多语言语音模型的人,大概都经历过同一种卡壳:模型结构调好了,算力也排上了,最后卡在数据上——手里那几种语言的语料翻来覆去用,稀缺语种连几百小时都凑不齐。

ESPnet 这次放出的 YODAS v3,直接把这个瓶颈往前推了一大步。它是一个大规模开源多语言网络音频数据集,规模是 110 万小时,覆盖 100 多种语言。

不只是量大

数据集的价值从来不只在小时数。YODAS v3 同时提供了词级和句级时间戳、英文翻译,以及音频的技术参数。这几项加起来,意味着数据拿到手就能往端到端流程里送,不需要再花大量时间做预处理和对齐。

对做语音识别(ASR)、语音合成(TTS)以及音频表征模型的研究者来说,这省下的是最枯燥也最耗时的那一段。

稀缺语种的那道坎

多语言模型训练里,真正难的不是英语、中文这些资源充足的语言,而是那些语料稀薄的语种。数据量上不去,模型在这些语言上的表现就很难看。

110 万小时、100 多种语言的组合,针对的正是这个缺口。语种覆盖广了,稀缺语种才有机会被喂到足够的数据。

另一个容易被忽略的点是版权。这套数据集明确无版权问题,对需要长期迭代、反复训练的项目来说,这一条的分量不比数据量轻。

门槛被拉低之后

高质量基准数据的意义,是把竞争从"谁手里有数据"挪到"谁把模型做得更好"。YODAS v3 开源之后,多语言语音 AI 的入场券便宜了不少。

接下来值得看的是,这批数据会被用来训出什么样的模型。