Meta的AI布局又落一子。扎克伯格宣布,Muse Voice Transcribe于当日正式推出,这是MSL(Meta超级智能实验室)首个实时音频感知模型。
这款模型在流式语音转文字任务上达到SOTA(当前最优)水平。更关键的是,它在单一模型内原生支持说话人分离和端点检测,无需额外拼接多个系统。
打开网易新闻 查看精彩图片
这意味着,实时会议转录、多人口述记录等场景,有望在更低的延迟和复杂度下实现。
Meta的AI布局又落一子。扎克伯格宣布,Muse Voice Transcribe于当日正式推出,这是MSL(Meta超级智能实验室)首个实时音频感知模型。
这款模型在流式语音转文字任务上达到SOTA(当前最优)水平。更关键的是,它在单一模型内原生支持说话人分离和端点检测,无需额外拼接多个系统。
这意味着,实时会议转录、多人口述记录等场景,有望在更低的延迟和复杂度下实现。
热门跟贴