微软的语音模型 MAI-Voice-2.1 已经在 OpenRouter 上线。这是微软 AI 团队目前保真度最高、表现力最强的文本转语音模型。
它被定位为面向有声书、播客、旁白和品牌音频场景的工具。换句话说,不是给开发者做实验用的玩具,而是直接冲着内容生产去的。
打开网易新闻 查看精彩图片
一个声音,说23种语言
官方给出的核心能力有三点:录音棚级别的自然语音;同一个声音可以用 23 种语言说话,同时保持母语口音;定价为每 100 万字符 22 美元。
第二点值得单独拎出来看。传统做法里,多语言配音往往意味着换人、换声线,或者接受明显的"翻译腔"。同一个声音跨语言还能保住母语口音,指向的是品牌音频和有声内容里最实际的一个需求:辨识度不能丢。
定价指向谁
每百万字符 22 美元,配合有声书、播客、旁白这些场景,目标用户画像并不模糊——需要批量生产音频、又不想在录音棚上烧预算的团队。
模型已经上线 OpenRouter,可以直接调用。
热门跟贴