微软的人工智能研究实验室Microsoft AI日前在官方博客上宣布,他们的MAI产品线再添两款自研模型变体:MAI-Image-2.5-Pro 与 MAI-Voice-2-Flash,这两款模型目前已进入公开预览(public preview)阶段。

其中,MAI-Image-2.5-Pro 定位为“质量优先”的旗舰图像模型,是微软迄今保真度最高的图像模型,主打高精度图像生成、细节化编辑以及准确的图内文字渲染(in-image text rendering),并支持自然语言指令编辑。定价为每百万文本输入 token 5 美元、每百万图像输入 token 8 美元、每百万图像输出 token 106 美元。

MAI-Voice-2-Flash 则主打速度与规模,面向高并发语音场景。相比 MAI-Voice-2,其速度提升 2 倍、成本降低 32%,定价为每百万字符 15 美元,同时在自然韵律(prosody)与声学质量上保持旗舰水准。

打开网易新闻 查看精彩图片

值得注意的是,这两款模型并非仅停留在榜单刷分。微软强调,自研 MAI 系列已大规模落地核心产品:Bing Image Creator 已 100% 切换至 MAI-Image-2.5;PowerPoint 的图像生成与编辑中,MAI-Image-2.5的GPU 成本较 GPT-Image-2 降低最多 84%;而OneDrive 图像编辑场景切换为 MAI-Image-2.5 后,保存率提升 26%、P95 延迟下降约 25%;Dynamics 365 Contact Center(客户含 T-Mobile、EasyJet)改用 MAI-Voice-2-Flash,GPU 成本最多降 89%。

此外,微软还提到了他们在专业领域上的成果——他们与医疗方案 Dragon Copilot 合作,后者服务 17 万医疗提供者、上季度处理 2800 万次就诊记录;MAI-Transcribe-1.5 已接替原有模型,覆盖 58 种语言,在多数语言上转录与语种识别错误率相对下降 50%。

微软表示,这一系列更新都指向同一目标——用微软自研模型驱动微软自有产品;其强调模型在内部训练、不依赖第三方模型蒸馏,并希望通过提供质量、速度、成本各异的模型选项,让用户与开发者获得更多选择与更高性价比。