9 月 21 日,过去一周迅速走红的 AI 模型 Jev,正式宣布向所有用户开放。
开发团队 TypeSafe AI 当天宣布取消候补名单,任何人都可以直接注册使用,新用户还可获得 5 美元初始额度。
就在几天前,Jev 还只是一个刚刚发布的新模型,但很快就在硅谷开发者社区里火了起来。Vercel、LangChain、Browser Use 等平台和团队陆续接入,各种 Demo 也开始密集出现。更特别的是,它几乎完全不同于过去几年人们熟悉的大模型形态。它不聊天、不写文章,甚至不会生成一句完整的话。
开发者只需要给它一段复杂的状态信息,再规定需要回答的问题和候选结果,Jev 就会直接返回一个结构化判断以及对应概率。比如,不是让模型解释“这个客户是否可能流失”,而是直接得到“流失概率 82%”;不是让它分析 Agent 下一步应该做什么,而是直接从几个候选动作里选出一个。
TypeSafe 把这类模型称为 System One Model,名字来自丹尼尔·卡尼曼《思考,快与慢》里的“系统一”。代表一种快速、直觉式的判断机制。
它由前 OpenAI 研究员 Diogo Almeida 创立的 TypeSafe AI 推出。Almeida 曾参与 InstructGPT 和早期 RLHF 研究,离开 OpenAI 后与团队研发 Jev 约两年。公司此次亮相时也披露完成 4,000 万美元种子轮融资。
一周内,开发者把 Jev 塞进了各种软件
9 月 18 日,Vercel 公布数据称,Jev 接入 AI Gateway 后 24 小时,已有接近 13% 的付费团队使用过它,是 GPT-5.6 系列同期的两倍以上。Vercel 因此把 Jev 称为 AI Gateway 历史上“被采用最快”的模型。截至 9 月 20 日,其公开榜单显示,Jev 的团队覆盖率已经升至 27.8%,请求量占比达到 20.8%。
真正让 Jev 快速出圈的,则是一批开发者做出来的 Demo。
例如浏览器自动化团队 Browser Use 做了一个名为 jev-ultrafast 的浏览器 Agent。用户只需要给出一句任务,比如“帮我找 9 月 20 日从苏黎世飞往伦敦的单程航班”,系统就会读取网页上的按钮、输入框和下拉菜单,并把它们整理成一张可操作的元素列表。
在这个过程中,Jev 不负责生成整套操作过程,而是在每一步快速判断“接下来做什么、操作哪个元素”,例如点击出发地输入框、选择日期或者按下搜索按钮;只有遇到“输入 Zurich(苏黎世)”这类需要生成文字的动作时,才临时调用一个小型语言模型。公开演示中,这套 Agent 在 Google Flights 上找到对应航班只用了 7.1 秒,单次运行成本约 0.0039 美元;项目记录的 Jev 决策延迟中位数约为 178 毫秒。
(来源:X)
另一个案例发生在沙盒游戏《我的世界》(Minecraft)里。开发者 Ronak Malde 把 GPT-6 Astra 和 Jev 组成了一套游戏 Agent:Astra 像“指挥官”,负责规划接下来要收集什么物资、走什么路线、怎样前往末地并击杀末影龙;Jev 则负责根据角色当前看到的游戏状态,快速决定眼下具体执行哪个动作;真正的移动、转向和操作再由程序发送到游戏中。
最新一次测试里,这个 Agent 从空背包开始,在一个新的生存模式世界中自行收集物资、利用下界赶路,最后用床爆炸击杀末影龙,全程用时 8 分 43 秒,开发者称模型调用成本不到 1 美元。
(来源:X)
LangChain 则把 Jev 拿去做 Agent 评测。在 9 月 20 日公布的一组实验里,Jev 平均每次判断耗时约 0.44 秒,成本约 0.00035 美元;在连续打分任务上,它的分数方差比参与比较的 GPT-5.6 Luna、Terra 和 Claude Sonnet 4.6 低 92~913 倍。
这些案例有一个共同点。开发者没有把 Jev 当成另一个聊天机器人,而是在代码原本需要做一次语义判断的地方,把它塞进去。相比传统大模型,最直观的体验差异是快得多,也便宜得多。过去一个 Agent 每走一步,都可能要等模型生成几秒钟。但由于Jev 不生成文字,只返回判断和概率,很多调用可以压到几百毫秒以内。
为什么偏偏是一个“不说话”的模型火了?
有舍才有得。Jev 能够达到这些效果,在于它主动放弃了大语言模型最擅长的一部分能力——文本生成。
传统大模型依赖自回归解码,一个 token 接一个 token 往后生成。但现实中的大量工程场景,真正需要的往往只是一个明确结果:通过还是拒绝、几个选项中选哪一个,或者一个风险概率。为了拿到这些字段,传统方案通常仍要先让模型生成一段文本或 JSON,再由下游程序解析和校验。
Jev 直接砍掉了这一步,它把输出限制在 Choice、Score 或 Bool 等结构化结果中,并支持多个判断并行执行。省去逐 token 串行生成之后,推理延迟和调用成本也随之大幅下降。
与这种极简输出配套的,是 TypeSafe 提出的 RLCD(校准决策强化学习)。它关注的不只是答案对不对,还包括模型给出的概率是否与真实准确率匹配:如果模型长期给出“90% 的把握”,这些判断在统计意义上的正确率也应该接近 90%。对于自动化系统来说,这种校准尤其重要,因为它可以直接成为分流依据:高置信度结果自动执行,低置信度结果再交给更强模型或人工复核。
不过,想要真正看清 Jev,还逃不开另一个问题:它是一个新模型吗?
Jev 上线后,不少开发者的第一反应就是:“这不就是一个分类器吗?”这种质疑并不是没有依据。Transformer 编码器、判别模型和 reranker 早已可以在有限候选项之间打分,Jev 的确没有凭空发明一种全新的判断能力。
它真正不同的地方,更接近于把过去高度专用的分类能力做成一个通用模型。
传统分类器往往围绕固定任务和固定标签训练,而 Jev 允许开发者在运行时直接用自然语言定义问题和候选项,不需要为每一套标签重新训练。同一个模型,既可以给工单分流,也可以判断一次工具调用是否存在风险,还可以给 Agent 的输出打分。大模型研究者 Sebastian Raschka 也认为,这种面向动态标签的零样本泛化能力,是 Jev 与传统封闭式分类器的重要区别。
不过目前,TypeSafe 尚未完整公开 Jev 的网络架构细节和参数规模,外界已知的是它采用 Transformer 路线,并使用合成数据训练。社区测试中也已经出现一些问题,例如改变候选项的排列顺序,可能明显影响输出概率;在部分真实数据集上,它的概率校准也未必优于 CatBoost 等传统算法。TypeSafe 自己同样承认,Jev 在算术、计数、日期和对抗性输入等任务上仍然不够稳定。
所以,Jev 不是一次底层架构革命。它更值得关注的地方,在于提出了一种更明确的模型分工。复杂推理和长程规划交给大语言模型,确定性的业务逻辑继续交给代码,而大量高频、边界清晰的“快判断”,则单独交给 Jev。
这和它的名字来源倒也十分相称。Jev 的名字取自经济学中的“杰文斯悖论”,意思是当一种资源的使用效率提高、单次成本下降后,总使用量反而可能随之增长。TypeSafe 押注的正是这一点,未来的软件不一定需要在每一步都调用昂贵的大模型,便宜又大碗的智能判断才是市场想要的。
1.https://www.typesafe.ai/blog/introducing-jev
2.https://www.typesafe.ai/
3.https://docs.typesafe.ai/
4.https://techcrunch.com/2026/09/15/former-openai-researcher-diogo-almeida-launches-typesafe-ai/
5.https://vercel.com/blog/ai-gateway-jev-model-launch
6.https://vercel.com/ai-gateway/leaderboards/models
7.https://github.com/browser-use/jev-ultrafast
8.https://github.com/rmalde/minecraft-agent
9.https://blog.langchain.com/jev-as-a-judge/
10.https://sebastianraschka.com/
11.https://en.wikipedia.org/wiki/Jevons_paradox
运营/排版:何晨龙
注:封面/首图由 AI 辅助生成
热门跟贴