刚刚,微软发布了新模型,Microsoft-Decision-1,专门做结构化决策任务。
官方给的几个数字:基于 Qwen3.5-9B 后训练,36 项基准测试里准确率最高;速度比 Quyet-1.0-Large 快 4.5 倍,比 GPT-6 Sol 快 35 倍。
最扎眼的是定价:每百万 Token 输入 0.042 美元,输出免费。
模型本身的新闻点,说实话就这些。「输出免费」这四个字,才是值得坐下来聊的东西。
为什么输出敢免费
先看这类模型的账单长什么样。结构化决策任务——比如从一堆候选里选一个、给数据判个类别、按规则出个结论—— workload 的形状很特别:输入长,输出短。
输入是全部上下文:数据、候选方案、约束条件、历史记录,可能几千上万 Token。输出呢?一个选项、一个分数、一段几句话的结论,撑死几百 Token。
换句话说,这个场景里收入本来就主要来自输入侧。输出免费,与其说是让利,不如说是把真实的成本结构摊开明说——反正输出那头就没打算赚你钱,不如做成钩子。
这比「全场五折」诚实多了。定价跟着 workload 形状走,说明微软对这个模型该用在哪、怎么被用,想得挺清楚。
9B 的专才,凭什么打大模型
另一个值得琢磨的点:底子是 Qwen3.5-9B,不到百亿参数的小模型,专才路线。
「36 项基准准确率最高」这话要打折听——自测基准的水分,圈内都懂,等第三方复测。但方向本身成立:决策任务不需要写小说的能力,不需要跨学科闲聊,它需要的是把规则和数据吃透、给出稳定可复现的判断。这类窄任务上,专门调过的小模型打通用大模型,不是新鲜事,是正在变多的事。
速度差距更说明问题。比 GPT-6 Sol 快 35 倍,不是因为 9B 跑得比人家旗舰快 35 倍,而是任务匹配:决策要的就是快而稳的短输出,通用旗舰在这个场景里一大半算力花在了不需要的地方。
给 Agent 干活的团队应该有感觉:决策环节卡一秒,整条链路就卡一秒。快 35 倍不是跑分意义的快,是流水线意义的快。
微软的底座是阿里的模型
还有个容易滑过去的细节:后训练的底座是 Qwen,不是微软自家的。
这事放在本周的语境里特别顺:谷歌把 Claude 摆上自家货架,通义放图像模型权重,微软拿 Qwen 底座做行业专才。大家已经不装了——好底座就用,谁的都行,自己赚的是场景和生态的钱。
上一轮大模型竞争是「我家模型天下第一」,这一轮是「我家管道里什么模型都有」。模型在变成零件,平台在变成插座。
真要用的话,先过三关
- 基准复测。
- 「36 项最高」是官方口径,拿你自己的真实决策数据跑一遍对比,比看榜单靠谱十倍;
- 输出免费的边界。
- 速率限制、上下文上限、「免费」会不会哪天改口,条款看清楚再把业务押上去;
- 任务匹配度。
- 它是决策专才,别指望它顺手写文案。拿它干窄活是降本,拿它干宽活是给自己找麻烦。
三关都过了,0.042 美元的输入价加上白送的输出,在决策类场景里确实很难打。决策环节从「用旗舰模型顺手做」到「用专用模型专门做」,这一步微软只是走得靠前,后面排队的人不会少。
你们团队的决策环节,现在是旗舰模型顺手做的,还是已经有专用方案了?评论区聊聊成本差多少。
热门跟贴