亚马逊 Strands Agents 团队本月1日放出了一个叫 Strands Decider 2B 的决策模型。它已经在 GitHub 上开源,权重能在 Hugging Face 上找到,而且可以直接在本地的 CPU 或 GPU 上跑起来。

这个模型的做法有点意思。它没有从零训练,而是拿预训练的 Qwen3.5-2B 当“躯干”,然后把原来负责文本生成的语言模型“头部”换掉,装上一个具备评分功能的指针“头部”。

打开网易新闻 查看精彩图片

换头之后,参数去哪了

新“头部”的规模很小,总参数只略超过一百万。“躯干”部分则通过一个 rank-16 LoRA 适配器做微调。也就是说,真正被改动的部分并不多,大部分能力还是沿用原来的底子。

这种“换头”思路的好处是,模型不用重新学怎么生成文字,只需要学会怎么打分、怎么做决策。

排名和时延,两个硬指标

在 JevBench 公开数据集上,Strands Decider 2B 的准确率和校准度表现不错。它在 2B 级别模型中排到第 3,并且优于所有严格不超过 2B 的竞争对手。

本地运行的时延数据也摆出来了:

  • 在市面常见硬件上,决策时延中位数为 113ms
  • 在 NVIDIA GeForce RTX 3090 上执行小型决策任务,中位数时延是 153ms

113ms 这个数字,意味着它能在本地硬件上完成一次决策判断,不需要把请求发到云端。对于需要低延迟、又不想把数据传出去的任务来说,这个组合值得关注。