微软在2026年10月1日发布了一款实时转写AI,名字叫MAI-Transcribe-2-Streaming。这是微软第一款流式转写模型,官方给出的定位很直接:比竞品错误率更低,延迟更短。
第三方机构Artificial Analysis做了性能分析。在测试覆盖的实时转写模型里,MAI-Transcribe-2-Streaming的错误率是最低的。另一张图把延迟秒数放在横轴、错误率放在纵轴,结论是:和同等精度的模型相比,它的延迟更短。
它到底解决了什么问题
实时转写这件事,难点从来不在"能不能转",而在"转得准"和"转得快"能不能同时成立。精度上去了,延迟往往跟着涨;延迟压下来,错误率又容易失控。微软这次拿出的两张分析图,一张证明错误率最低,一张证明同等精度下延迟更短,指向的正是这个平衡点。
这也是它被标为"微软首款实时转写模型"的原因。此前微软在这个方向上并没有流式产品,MAI-Transcribe-2-Streaming补上了这块空白。
怎么用,多少钱
模型通过API提供,接入方式是Realtime API,归在Speech Service之下。定价方面,2026年底之前每小时0.54美元,按素材给出的汇率约合85日元。
- 产品名:MAI-Transcribe-2-Streaming
- 发布时间:2026年10月1日
- 接入方式:API(Realtime API)
- 价格:2026年底前每小时0.54美元
这个价格对应的是实时场景——不是把一段录音丢进去等结果,而是边说边出文字。对需要即时字幕、会议记录、直播转写的使用者来说,计费单位是小时,成本可以直接按使用时长估算。
竞争格局里的一步
实时转写这条赛道上,近期动作不少。谷歌发布过Gemini 3.5 Transcribe,主打自动删除"啊""呃"这类语气词的同时实时转写;Meta推出过Muse Voice Transcribe;英伟达则以开放模型的形式公开了NVIDIA Nemotron 3 Diarization,支持最多8人说话人识别并实时转写。微软此前还发布过MAI-Transcribe-2,官方对比中称其比Gemini 3.5 Transcribe快5倍、比GPT-Transcribe快10倍。
MAI-Transcribe-2-Streaming是这条产品线的流式版本。从命名就能看出延续关系:同一个MAI-Transcribe-2系列,加上Streaming后缀,指向实时能力。
微软这次没有铺开讲技术细节,给出的核心信息集中在三点:首款流式模型、第三方评测中错误率最低、同等精度下延迟更短。加上一个明确的时间窗口价格——2026年底前每小时0.54美元。对开发者来说,判断要不要接入,这三个指标加一个价格,基本够用了。
热门跟贴