语音正在变成人和机器人打交道的主要方式之一。这个判断来自 @humynlabs 的一条分享,他们给出的理由是:当机器人要听懂物理世界里真实发生的对话,语音识别的分量会比现在看起来重得多。

问题在于,真实对话很难转写。人们会停顿,会互相抢话,还会在一句话中间切换语言。这些恰恰是实验室里录出来的干净语音不会出现的情况。

打开网易新闻 查看精彩图片

被忽略的超55亿人

@humynlabs 提到一个数字:全球南方有超过 55 亿 非英语使用者。机器人要真正听懂人说话,就得覆盖这些人实际使用的语言,而不是只盯着英语。

但社区一直缺少一个能衡量这类前沿能力的好办法。于是 @humynlabs 做了 BRIDGE ASR 2.0,一个专门用来测这件事的基准。

测什么,怎么测

这个基准的测试对象是 23 个 语音识别模型,任务素材是真实的双人对话,每段时长 10 到 15 分钟。覆盖的语言包括 18 种印度语言,外加西班牙语、葡萄牙语和越南语。

@humynlabs 认为最有用的一个指标是 code-switch F1。它检查的是:一句印度语言里混进来的英语词,有没有被原样保留成英语。

举个具体的例子——如果模型把 "data backup" 写成天城文,这个指标上就是零分。

榜单可以自己筛

排行榜支持按语言筛选,也支持按指标筛选。方法和评测数据都是公开的,团队希望研究者去测这个基准,并且找出它在哪些地方会失效。

基准地址是 humynlabs.ai/bridge/ASR/2.0。这条分享发布于 9 月 25 日下午 2:47,目前有 1715 次浏览。