当地时间10月1日,微软一口气发布了三款语音相关模型。其中一款叫 MAI-Transcribe-2-Streaming,主打实时转写;另外两款是 MAI-Voice-2.1 和 MAI-Voice-2.1-Flash,负责语音生成方向。

真正让开发者坐不住的,是价格。

打开网易新闻 查看精彩图片

三款模型,三档定价

打开网易新闻 查看精彩图片

微软给 MAI-Transcribe-2-Streaming 定了一个首发优惠价:每音频小时0.54美元,这个价格会持续到年底前。语音生成这边,MAI-Voice-2.1 按字符计费,每100万字符22美元;轻量版 MAI-Voice-2.1-Flash 则是每100万字符15美元。

三款产品同时放出,覆盖了语音转写和语音合成两条线,定价也拉开了梯度。

为什么盯上语音这条线

实时转写按音频小时计价,意味着成本跟使用时长直接挂钩。对做会议记录、直播字幕、客服质检这类场景的团队来说,这个价格是可以直接算进预算表的。

打开网易新闻 查看精彩图片

语音生成按字符计价,则更贴近内容生产的用量逻辑——生成多少字,付多少钱。

首发优惠价截止到年底,这个时间窗口本身也是一种信号:微软想先把开发者拉进来跑起来。

至于这套定价能不能搅动现有的语音模型市场,还要看后续实际调用中的表现。