微软的语音模型 MAI-Voice-2.1 已经在 OpenRouter 上线。这是微软 AI 团队目前保真度最高、表现力最强的文本转语音模型。

它被定位为面向有声书、播客、旁白和品牌音频场景的工具。换句话说,不是给开发者做实验用的玩具,而是直接冲着内容生产去的。

打开网易新闻 查看精彩图片

一个声音,说23种语言

官方给出的核心能力有三点:录音棚级别的自然语音;同一个声音可以用 23 种语言说话,同时保持母语口音;定价为每 100 万字符 22 美元。

第二点值得单独拎出来看。传统做法里,多语言配音往往意味着换人、换声线,或者接受明显的"翻译腔"。同一个声音跨语言还能保住母语口音,指向的是品牌音频和有声内容里最实际的一个需求:辨识度不能丢。

定价指向谁

每百万字符 22 美元,配合有声书、播客、旁白这些场景,目标用户画像并不模糊——需要批量生产音频、又不想在录音棚上烧预算的团队。

模型已经上线 OpenRouter,可以直接调用。