把上下文、问题、几个固定选项一起丢进去,它回你一个选项、一个分数,或者一个是非判断,每个答案都带概率。这就是 Jev,一个把"判断"包装成函数调用的分类器模型。
2026年9月15日,旧金山一家名为 TypeSafe AI 的实验室发布了它。发布后24小时内,Vercel AI Gateway 上13%的付费团队用上了它,TechCrunch 报道称需求一度把它挤到离线。
有人用它给 newsletter 打分,处理超过5000篇文章,总共花了35美分。
它其实是个老概念穿了新鞋
剥掉发布话术,形状很熟悉:输入进去,从一组固定标签里出来一个,通常还附带概率。弗兰克·罗森布拉特1958年就造过一个,叫感知机。四十年后,Mehran Sahami、Susan Dumais、David Heckerman 和 Eric Horvitz 在微软研究院发表了一个贝叶斯垃圾邮件过滤器,给每封邮件打分再对照阈值。
同样的模式在批准你的信用卡,也在挑选你看到的广告。开源方案已经免费了十年:fastText 从2016年起就能给文本分类,谷歌的 BERT 编码器从2018年起可以微调,Answer.AI 在2024年做了 ModernBERT 来干 Jev 现在推销的活。
TypeSafe 用合成数据在前沿规模上训练了这个形状,发布文章把结果对标聊天模型,而不是对标微调过的开源分类器——所以这个差距目前还没有被测量。
一次调用到底怎么跑
输入是一段状态:一张支持工单、一个填到一半的表单、一个智能体想发起的工具调用。再加上一组问题,一组固定选项。
输出有三种形态:
- 你命名的选项(Choice)
- 一个分数(Score),落在你定义的量程上
- 一个是非判断(TypeSafe 叫它 Noul),返回"是"的置信度,0到1
文档允许一次请求带几十个问题,并行一遍答完,而不是逐字生成——速度就来自这里:按 TypeSafe 自己的西海岸测量,端到端70到500毫秒。
每个答案带两个数字:每个选项的概率,以及这个问题的置信度。一个返回0.08的 Noul 不是不确定,它认为答案是否。一个在三个选项上摊成0.4、0.35、0.25的 Choice,是在告诉你这段状态还不足以定论。
这让 Jev 更靠近确定性那一端。答案仍然是概率,但输出形状是预先固定的,类型错误不可能发生,TypeSafe 说相似的状态会返回相似的答案。
幻觉问题被推给了设阈值的人
Jev 不会幻觉,因为它只能从你给的选项里挑。但它会挑错,而且它会告诉你自己有多确定。
Earendil 首席技术官 Armin Ronacher 对 TechCrunch 说,这个模型"把幻觉问题稍微委托给了用户"。那个用户得决定:50%是不是该当成抛硬币忽略掉,95%是不是该照着执行。
Jev 把判断从模型挪到了设定阈值的人身上。这个人应该是设计师,阈值应该写进规格文档,就放在错误状态旁边。
按十亿计价,不是按百万
TypeSafe 给 Jev 的定价是每百万输入 token 0.042美元,输出免费,也就是每十亿42美元。它的对比表把前沿聊天模型放在每百万输入0.20到10美元之间,输出成本约为输入的5倍。
按这个最新成本算,它比 Claude Fable 5.1 便宜250倍。另外那些194倍更快、445倍更便宜的头条倍数,来自 TypeSafe 自己的流程评估,发布文章也这么说了,并补充说目前还无法证明这个定价没有补贴。把这些当成上限看。
热门跟贴