Meta把语音转写这条赛道又搅动了一次。近日,Meta旗下超级智能实验室(Superintelligence Labs)正式推出实时语音识别模型Muse Voice Transcribe,官方称这是Meta首个实时音频感知模型,开发者通过Meta Model API即可调用。
第三方评测机构Artificial Analysis发布的AA-WER Streaming英语语音转写准确率基准显示,Muse Voice Transcribe的词错率为3.1%。作为对比,Cartesia Ink-2为3.4%,ElevenLabs Scribe v2 Real-time为3.6%,OpenAI GPT Live Transcribe为3.9%,谷歌Gemini 3.5 Transcribe Live为4.0%。在说话人区分能力上,Muse Voice Transcribe在多个标准基准中的平均错误率为17.5%,同样处于领先位置。不过整体来看,各家模型在这一维度上的表现都还难以让用户满意。Meta方面介绍,该模型可区分超过20位说话人,并支持超过70种语言。
一段夹杂多种语言、多人插话的会议录音,可以被实时拆分为不同说话人的分轨转写结果。
定价方面,Muse Voice Transcribe通过Meta Model API对外提供,价格为每1000分钟音频3美元,折合约每小时0.18美元。Meta方面同时确认,该模型不会开放权重。
市场有风险,投资需谨慎。本文为AI基于第三方数据生成,仅供参考,不构成个人投资建议。
本文源自:市场资讯
作者:听潮
热门跟贴