微软发布了一个叫 Microsoft-Decision-1 的模型。它不聊天,只做决策——分类、路由、评分,以及 Agent 流程控制。

这个模型基于开放权重的 Qwen3.5-9B 微调而来,接受文本输入,输出的是结构化概率分布。换句话说,它给出的不是一个句子,而是一组可以直接喂给下游系统的判断结果。

三个数字看懂它

微软公布的评测数据里,有三个数字值得单独拎出来看:

  • 平均准确率 83.5%,覆盖 36 项基准
  • 中位延迟 85 毫秒
  • 输入扰动测试中表现稳定

83.5% 这个数字放在通用大模型的榜单里不算惊艳,但它的评测场景是决策任务,不是聊天或写作。36 项基准的平均值,说明这不是挑单项刷出来的成绩。

85 毫秒的中位延迟更关键。这个量级意味着它可以嵌进实时或交互式应用里——用户还没感觉到等待,决策已经做完了。

为什么是决策模型

Agent 流程里最容易被忽略的环节,往往不是生成内容,而是判断下一步该走哪条路。分类、路由、评分,这些动作看起来简单,但如果每次都要调用一个通用大模型来完成,延迟和成本都会迅速堆高。

微软的做法是把这类任务单独拆出来,用一个专门微调过的模型来处理。它不负责写文案,不负责陪聊,只负责给出结构化的判断结果。

输入扰动测试的稳定性也指向同一个方向:决策模型面对的实际输入往往不规范,拼写错误、格式混乱、多余字符都是常态。模型在这种条件下还能保持稳定输出,才具备上生产的资格。

怎么用

目前这个模型通过两个渠道提供托管服务:Azure 上的 Microsoft Foundry,以及 OpenRouter。不需要自己部署,直接调用 API 即可。

对于正在搭 Agent 流程的团队来说,这类专用决策模型的思路值得留意——把判断和生成拆开,各用各的模型,可能比一个通用模型包打天下更划算。