单步决策 122 到 128 毫秒。这是开源视觉决策模型 Valen 给出的官方数据。四局并行跑下来,总耗时 1.24 秒。

这个数字放在大模型推理的语境里,意味着另一种思路:不追求一次想清楚,而是追求快速反应。

它到底在做什么

Valen 的定位是视觉决策模型。看图或者看状态,在给定的候选动作或选项上直接打分,输出概率。底层用 Qwen3.5-0.8B 或 2B 做视觉与文本表征,再接一个共享决策头完成打分。

它把 System One 的直觉式决策机制,从文本领域搬到了视觉世界。不是让模型把画面描述一遍再推理,而是直接对动作选项给出倾向。

为什么需要这种快

传统大模型推理慢,不适合实时交互。而有一类场景恰恰等不起:

  • GUI Agent 处理弹窗、判断按钮状态
  • 游戏 Agent 规划走位
  • 机器人避障

这些环节的特点是高频、碎片化,需要的是毫秒级反射,而不是一次完整的深度思考。Valen 瞄准的就是这层反射。

小参数的另一条路

0.8B 和 2B 的参数量,配上共享决策头的架构,Valen 展示的是低延迟视觉决策的可行性。把直觉反应模式引入视觉任务,用 Qwen3.5 小模型提特征,再接决策头对候选动作快速打分。

这条路子和堆参数、拉长推理链的方向不同。它要解决的不是"想得更深",而是"反应得更快"——在需要即时判断的环节里,把决策压缩进百毫秒级的时间窗。