一个不会聊天的模型,被塞进了国际象棋排行榜,结果排到了第59名,Elo约243,旁边站着的是qwen3.6-27b和o4-mini-medium。

TypeSafe的Jev就是这么个怪东西。它不是聊天模型——你给它一个状态,再加上一组带类型的提问(Choice/Score/Noul),它回给你带概率的标签。像分类器,但输入可以是自由文本,标签每次由你自己定。

打开网易新闻 查看精彩图片

LLM Chess这个评测场子,跑的一直是聊天模型。它们以智能体方式对局,走一套多轮协议:get_current_boardget_legal_movesmake_move 。Jev不干这些。那还能不能把它放上同一张榜?答案是可以——前提是你按它期待的方式跟它说话。

先说清楚:这是一次外部评测

TypeSafe对刷榜这件事是公开反感的。在System One/Jev的发布文章里,他们说现有的LLM基准测试在这里并不真正适用,也跳过了常规的公开评测榜单,没把自家模型和其他模型摆在一起比。他们更愿意用带日期的内部快照。

但作者还是把Jev放上了LLM Chess——同一套测试框架,同一批对手,和那些聊天模型一样。

跟Jev对话的感觉,有点像跟霍金对话:聪明,但没有自由发言权。答案不会以自由形式吐出来。

国际象棋之外,作者试过一个有点傻的下一字符循环:在a到z加上之间做Choice,每生成一个字母调一次API。让它拼blue,或者补全hel…,它吐出来的是半成品词——bue、helhoh。从pari…开始,它倒是补出了paris。从零开始生成很弱,补全一个不完整的片段反而更好用。

一份固定的合法棋步清单,比一个字母一个字母地拼英文,适配这个模型得多。

怎么把它接进LLM Chess

每一步的接法是这样的:

  • 状态:{ fen, side_to_move }
  • 一次Choice:把所有合法UCI走法作为选项(SAN写在criteria文本里),上限255

Jev返回一个UCI字符串,转成make_move e7e5——和聊天模型发给评测运行器的是同一个动作。从外面看,几乎就是一次正常的评测交互。

价格是每100万输入token收0.042美元,输出免费。

结果方面,当前榜单上jev-latest大约排在第59位,Elo约243,紧挨着qwen3.6-27b和o4-mini-medium。Elo在这里被当作推理能力的一个代理指标,它落在中游推理模型/强小模型的同一区间里。

对局完成率是100%——完整下完,没有因为非法走法或对话中断而早死,协议遵循得完美,这正是类型安全换来的东西。

每局约36秒,每局约0.0015美元(每步约0.00002美元);80局总共约0.12美元,而Elo相邻的那些对手每局要花一美元以上。又快又便宜,便宜得离谱。

跟Dragon下,和棋率不降

Dragon执白对Jev执黑,每个等级下10局:L1、L2、L3三个等级,和棋率都是50%。平的。

大多数聊天模型不是这样——Dragon越强,和棋通常越少,因为引擎能把更多对局终结掉。但在这里,和棋率横跨三个等级都没有下降。这对Elo是有帮助的。

TypeSafe管这类模型叫System One:决策快,不做深度思考。

国际象棋仍然需要真正的选择——吃什么子、什么时候兑子、什么时候奔着和棋去。Jev没有聊天能力,每局成本只有零点几美分,却依然在Elo上落到了中游推理模型附近。所以这项技能不是“会写关于国际象棋的文字”,而是从一份清单里挑出一个走法。

几个可以带走的东西

TypeSafe并不想要一个公开排行榜来当自己的证明。这只是一次外部评测。

  • Jev适合那些你手上已经有一份选项清单的任务——工具、路线、标签、走法。让它一个字母一个字母地写英文是个糟糕的匹配(bue/helhoh)。
  • 每局约0.0015美元、约36秒,这是和美元级LLM评测完全不同的成本/速度量级。
  • 它有用的地方,是产品需要知道“选哪个选项”,而不是要一段文字——路由、结构化智能体、代码里的决策步骤。

榜单在LLM Chess,测试框架是maxim-saplin/llm_chess(feat/typesafe-jev-player分支/TypeSafe Jev player)。