Meta Superintelligence Labs 发布了一款名为 Muse Voice Transcribe 的实时音频感知模型,号称是业界首个此类产品。它最抓人的点在于,能一边听一边转写,不用等整段音频结束。
这模型在几个硬指标上挺能打:支持实时流式语音识别,能同时区分 20多个说话人,还自带判断谁该停、谁该接话的端点检测。多语言切换时也不用断流,中英混着说也能无缝跟上。
打开网易新闻 查看精彩图片
更聪明的是偏置功能。你可以通过设定语言、关键词或上下文,让模型在转写时"偏向"某些内容,比如人名、专业术语,准确率能明显提升。
打开网易新闻 查看精彩图片
在第三方评测机构 Artificial Analysis 的流式语音转文本和公开说话人分离基准上,Muse Voice Transcribe 目前都排在第一位。Meta 这次把实时音频理解的标杆又抬高了一截。
打开网易新闻 查看精彩图片
热门跟贴