Meta推出了其首个实时音频模型Muse Voice Transcribe。据Meta介绍,该模型可处理超过20个说话人的听写和转录任务,并能同时处理多种语言。
Meta CEO马克·扎克伯格在X平台上分享了该模型处理多说话人和多语言能力的演示视频。扎克伯格近期在停更三年后重返X平台。视频中,转录系统能够自动区分多个说话人并在语言之间切换,还能捕捉到"语码转换"——即使用多种语言词汇的句子。
打开网易新闻 查看精彩图片
扎克伯格在帖子中解释:"模型自己决定何时倾听。它在难词上多等一会儿,在简单词上更快提交,使用自适应延迟来预测每个token并提高准确性。"他还表示,模型在70多种语言的数据上进行了训练,其中25种语言在发布时已通过验证,支持句中语码切换,并能处理长达一小时、包含20多个说话人的会话。
Meta的发布距离谷歌推出Gemini 3.5 Transcribe不到一周。谷歌的音频模型具备类似能力,并计划将其集成到Android和Chrome中。目前尚不清楚Meta是否有计划将Muse Voice Transcribe整合到其旗舰服务中。
目前,用户可以通过Meta最近发布的Meta AI Mac应用体验该模型的能力。由于Mac应用能够为其他应用提供语音功能支持,Muse Voice Transcribe将为其听写功能提供动力。开发者可通过Muse Code和Meta的Model API使用该模型,定价为每1000音频分钟3美元。
Muse Voice Transcribe是Meta超级智能实验室(MSI)的最新成果。该模型将说话人分离和端点检测原生集成在单一模型中,而非拆分为多个模块。
热门跟贴