当地时间10月1日,微软一口气发布了三款语音相关模型。其中一款叫 MAI-Transcribe-2-Streaming,主打实时转写;另外两款是 MAI-Voice-2.1 和 MAI-Voice-2.1-Flash,负责语音生成方向。
真正让开发者坐不住的,是价格。
打开网易新闻 查看精彩图片
三款模型,三档定价
打开网易新闻 查看精彩图片
微软给 MAI-Transcribe-2-Streaming 定了一个首发优惠价:每音频小时0.54美元,这个价格会持续到年底前。语音生成这边,MAI-Voice-2.1 按字符计费,每100万字符22美元;轻量版 MAI-Voice-2.1-Flash 则是每100万字符15美元。
三款产品同时放出,覆盖了语音转写和语音合成两条线,定价也拉开了梯度。
为什么盯上语音这条线
实时转写按音频小时计价,意味着成本跟使用时长直接挂钩。对做会议记录、直播字幕、客服质检这类场景的团队来说,这个价格是可以直接算进预算表的。
打开网易新闻 查看精彩图片
语音生成按字符计价,则更贴近内容生产的用量逻辑——生成多少字,付多少钱。
首发优惠价截止到年底,这个时间窗口本身也是一种信号:微软想先把开发者拉进来跑起来。
至于这套定价能不能搅动现有的语音模型市场,还要看后续实际调用中的表现。
热门跟贴