Meta Superintelligence Labs 发布了一款名为 Muse Voice Transcribe 的实时音频感知模型,官方称这是业内首个此类模型。它最直观的能力是:一边听一边转文字,不用等整段音频结束。
能同时分辨20多个说话人,还能自动判断谁在何时开口(diarization)以及何时结束发言(endpointing)。多语言切换时无需停顿,中英文夹杂也能无缝衔接。
打开网易新闻 查看精彩图片
更实用的是,它支持通过语言、关键词和上下文偏置来提升准确率——比如你提前告诉它"这段对话里会频繁出现某个专业术语",识别结果就能更准。
打开网易新闻 查看精彩图片
在第三方评测机构 Artificial Analysis 的流式语音转文本和公开 diarization 基准上,Muse Voice Transcribe 目前均排名第一。Meta 这次把实时语音识别的门槛又抬高了一截。
打开网易新闻 查看精彩图片
热门跟贴