自从 ChatGPT 出现,很多人对 AI 的印象就固定在了一个输入框里:你问,它答。

写文章、改代码、解释问题,这种方式很好用。可软件里的许多任务,根本不需要一篇回答。

一封邮件是否紧急?工单该分给谁?下一步要不要转人工?

程序需要的往往只是一个选项或分数。让通用模型反复处理这些小判断,等待时间和费用就会累积。

开发者已经在用结构化输出、小模型和固定规则解决这些问题。TypeSafe AI 提出了另一种尝试:把模型专门训练成一个做判断的工具。

它叫 Jev,不会写文章,也不陪你聊天。

01 实际效果怎么样?

先看它处理这些小判断的速度。

官方把同一组 27 个业务问题交给了 Jev 和 GPT-5.6 Terra。

界面记录的完成时间分别是 0.114 秒和 8.566 秒,费用分别为 0.000081 美元和 0.013880 美元。

这一次演示中,Jev 约快 75 倍,成本约为对方的 1/171。

打开网易新闻 查看精彩图片

▲ 视频:同一组 27 个问题的官方对照演示,原速节选;倍率仅对应本次演示。

外部测试也显示了类似取舍。

Every 用 12 段合成文字测试写作问题识别,Jev 比高推理设置的 Claude Fable 5.1 快约 25 倍,估算成本约为其 1/580;但 7 个预设问题只找到了 6 个,对方则全部找到。

样本很小,速度优势和漏检都值得保留。

当判断需要连续发生时,响应速度就更重要了。官方用 Doom 和维基百科跳转演示了这种用途:其中 Doom 输入的是整理后的文字状态,并非直接看画面。

打开网易新闻 查看精彩图片

▲ 视频:Jev 参与 Doom 实时控制的官方演示,原速节选。

不过,响应快还得看判断准不准。官方的成本—准确率图把两者放在一起:越靠左越便宜,越靠上准确率越高。Jev 位于最左侧,但准确率并非最高。

这里比较的是 4 个自建工作流的平均结果,参考答案来自其他强模型的预测,不能当成通用能力排名。

打开网易新闻 查看精彩图片

▲ 图:官方 4 个工作流评测。横轴为单次工作流成本,采用对数刻度;纵轴为该评测口径下的准确率。Jev 成本最低,准确率并非最高。

02 Jev 是什么,能做什么?

这些演示有个共同点:每一步都只需要一个判断结果。

TypeSafe AI 把专门处理这类任务的 Jev 称为决策模型。

创始人 Diogo Almeida 在 OpenAI 参与了 RLHF(基于人类反馈的强化学习)和 InstructGPT 的基础研究,研究如何让模型更好地遵循人的指令。

他是 InstructGPT 论文作者之一,也参与了 GPT-4 的指令遵循和 API 评测。

在 Jev 里,这类判断被做成了三种基本能力:从给定选项中选择(Choice)、按标准打分(Score),以及对一个陈述返回 0 到 1 的判断值(Noul)。

多个问题可以同时评估,结果直接交给软件使用。

官方文档举了一个例子:客户说 Stripe 账户连接失败已经三天,正在影响销售。

Jev 可以同时判断该分给哪个部门、客户有多不满、事情是否紧急。

程序拿到结果后,按规则分派工单;如果需要写回复,再交给能生成文字的模型。

安全告警、内容检查、邮件筛选,也可以这样拆成一连串小判断。下面这张官方示意图里,Jev 负责判断,代码负责把结果接到关闭、排队、通知等动作上。

打开网易新闻 查看精彩图片

▲ 图:TypeSafe 官方示例,多个 Jev 判断与普通代码组合成安全告警处理流程。

03 它和 ChatGPT 的区别在哪?

分派工单、筛选内容,聊天模型也能做。要看 Jev 的不同,得比较底层模型的输出方式:ChatGPT 是完整的助手产品,Jev 则是供软件调用的模型。

对比项

聊天模型

Jev

输出

文字、代码,也能输出结构化结果

预设选项、分数和概率

适合任务

写作、解释、开放式问答

分类、评分、流程中的小判断

使用方式

对话或通过 API 调用

作为判断环节接入软件

Jev 不生成自由文本,也不会展开解释为什么选了这个答案。

所以,区别不在于“能不能返回 JSON”,而在于专门做判断后,能否更快、更便宜,同时保持足够的准确率。

它还有一个明确的边界:选项只有 A、B、C,就不会凭空输出 D。但它仍可能把本该选 A 的题选成 B。

官方所说的类型安全,保证的是输出符合结构,不能理解成“零判断错误”。

TypeSafe 还强调概率校准:大量被赋予 80% 概率的事件,实际发生比例应接近 80%。

这是训练目标;返回一个精确到小数的数字,本身并不能证明判断可靠。是否适合自己的任务,还得拿实际材料检验。

04 我们怎么用?收费吗?

现在 Jev 仍处于 Early Access,官网有候补名单入口,也提供 Playground 和 API 接入文档。

Playground 需要登录,新账号是否立即获得权限,本文尚未验证。

拿到权限后,就可以先在 Playground 里输入一段业务材料,设定要判断的问题和选项;确认效果后,再通过 API 或 SDK 接进自己的软件。

比如内容团队可以先准备一批人工标注过的中文稿,让它检查“这段是否重复前文且没有新增信息”。

先看漏检和误报,再决定哪些结果自动处理、哪些交给编辑复核。问题越具体,越容易检验它到底有没有用。

官方当前标价是每百万输入 Token 0.042 美元,输出不收费。它是收费服务,“输出免费”也不代表整个请求免费。

05 最后

这样的价格,在任务反复发生时才更有吸引力。Jev 值得关注的用处也在这里:频繁地分流、检查,或选择下一步动作。

如果它能在自己的业务数据上保持可接受的错误率,速度和成本优势才会真正兑现。

对多数人来说,聊天模型仍然更通用。

但很显然聊天不是唯一的场景,很多行业内部的流程、系统、软件每天都有无数次的各种判断。

Jev 的机会,或许就在那里。

关注 AI范儿,一起看 AI 新工具能解决哪些实际问题。

06 参考资料

1. TypeSafe 官方发布说明与评测条件
https://typesafe.ai/blog/introducing-system-one-models-and-jev

2. Every 实测
https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds

3. OpenAI GPT-4 贡献名单
https://openai.com/contributions/gpt-4/

4. API 接入文档
https://docs.typesafe.ai/introduction/quickstart

5. TypeSafe 官网与价格
https://typesafe.ai/