微软推出专为结构化决策任务打造的新一代AI模型,在速度与成本上大幅领先现有大型语言模型。

周五,微软推出新一代快速决策AI模型Microsoft-Decision-1,该模型专为结构化决策任务设计。

微软称,Microsoft-Decision-1的P50已在内部多个场景完成测试,涵盖事故响应、质量控制和科学发现等领域。运行速度是OpenAI的GPT-6 Sol的35倍,Quyet-1.0-Large的4.5倍。

首席执行官Satya Nadella在X平台发文表示,该模型"在结构化决策任务上表现出色,在延迟和质量方面均优于大语言模型及其他决策模型",并已在微软内部用于事故响应、质量控制及科学研究等场景测试。

从定价来看,该模型输入端收费为每百万tokens 0.042美元,输出则免费,这一结构在成本层面对高频、重复性决策应用具有明显吸引力。

专注决策,填补大语言模型能力空白

与传统大语言模型侧重文本生成和复杂推理不同,Microsoft-Decision-1的设计目标更为聚焦。

Microsoft-Decision-1模型从预设选项中选取最优解,并为各备选答案赋予概率评分,从而帮助下游应用判断是继续执行、重新尝试、升级处理,还是交由人工审核。

(Microsoft-Decision-1 在准确率上排名第一,且是实测速度最快的模型)

微软表示,该模型覆盖近15万道问题的36项基准测试中准确率均排名第一。其功能定位包括路由分发、内容分类、任务优先级排序、结果验证及工作流控制,可无缝嵌入现有应用程序、AI代理及工作流系统。

不过,上述性能数据来源于微软自身的基准测试,独立第三方验证目前尚未完成。

内部测试显示速度与成本优势显著

微软强调,每个决策都会增加延迟,尤其当一个步骤依赖于另一个步骤时。例如,如果连续做出 20 个决策,每个决策都增加 100 毫秒,那么整个工作流程就会增加 2 秒。

Microsoft-Decision-1 P50 延迟速度是GPT-6 Sol的35倍。

(单次请求生成决策的时间,数值越低越好,取JevBench测试集的中位数)

Xbox Research团队使用其对逾1万条游戏反馈进行分类,结果显示与GPT-6 Sol质量相当,但速度达14倍以上,成本则降低约200倍。微软Copilot团队亦发现该模型在AI响应评估任务上与GPT-5.6 Luna表现相近。

(Microsoft-Decision-1 分类相同的文本,成本仅为 GPT-6 Sol 的几十分之一)

在技术架构上,Microsoft-Decision-1基于Qwen3.5-9B构建,经过以单次决策评分为核心的专项后训练。

微软还计划在未来将该模型迁移至其MAI系列模型及OpenAI模型等其他底座之上。

微软在公告中强调,该模型旨在"以安全、可信的环境将决策智能融入现有应用",将其定位为AI代理工作流编排的基础组件之一。

鲁棒性与安全性获重点强调

微软在设计中着重考量了模型的稳定性。

测试数据显示,在对同一请求进行八种形式的扰动处理后,Microsoft-Decision-1平均仅有1.3%的概率发生决策翻转,且在选项描述改写或选项顺序颠倒等场景下,翻转率为零。

在安全性方面,微软对该模型进行了涵盖11项基准、共5250条请求的测试,内容涉及有害内容识别、越狱攻击及提示词注入等,称模型在成功拒绝有害请求的同时保持了较高的正常使用效用。

目前,Microsoft-Decision-1已通过微软旗下AI开发平台Microsoft Foundry向开发者开放,OpenRouter的接入支持亦在计划之中。