打开网易新闻 查看精彩图片

这几天,硅谷有个 AI 模型「Jev」火了。

它最大的卖点,是不说话,只干一件事,「做判断」。

模型来自一家叫 TypeSafe AI 的公司,创始人是 Diogo Almeida,在 OpenAI 干过,是 RLHF 训练流程的早期核心贡献者,也是 2022 年那篇 InstructGPT 论文的作者之一。他参与的那套研究,后来成了 ChatGPT 的地基。

所以今天的故事是:一个把「让 AI 开口说话」做到极致的人,转身做了个「哑巴」。

1

先聊聊它的名字,三个字母,藏着一整套逻辑。

「Jev」 ,来自一个 19 世纪的经济学家,William Stanley Jevons,中文译作杰文斯。

1865 年,他写了本书,叫《煤炭问题》。

书里记了一个特别反直觉的现象。当时瓦特改良了蒸汽机,新机器烧煤效率比老机器高出一大截。按理说,机器越省煤,煤应该越省着用吧。

结果全英国的煤炭消耗量,不降反升——一台机器越省煤,整个国家烧的煤反而越多。

为啥呢?

因为煤变便宜了。便宜到以前用不起煤的行业,现在也用得起了,单台机器省下来的那点煤,被爆发式增长的用量吃得一干二净,还贴进去不少。

这就老黄经常卖token时候经常提到的「杰文斯悖论」,其实就是个「效率提升,成本下降,需求爆炸,总消耗不降反升」的原理。

TypeSafe 拿这个悖论给模型命名,意思就是,等一次判断便宜到可以忽略不计,它就会被塞进互联网与软件的每一个角落,无处不在。

这名字,就是一整篇宣言。

2

但光便宜没用啊,得看到底解决了什么。

咱们先还原一个所有后端工程师都经历过的场景。

用户刚提交了一笔订单,系统要判断:这单是本人下的,还是盗刷,所以结论应该就这个「是或否」。

以前的做法,得把这单信息打包,扔给一个上千亿参数的大模型,让它一个 token 一个 token 地把答案拼出来,你还在 prompt 里写满两页纸,反复叮嘱,只输出 JSON,不要废话,不要解释。

它大部分时候听话。但偶尔一次出点小问题,进程就挂了,但其实你要的只是一声「是」,来的却是个磨磨唧唧的老学究,非要把心路历程完整吟诵一遍,才告诉你答案。

所以,拿一个能写程序、解微积分的复杂大脑,去回答是非题,还按字数收钱,本身就很不划算,只是大家习惯了,没人较真,毕竟市场上,钱多,token用的多,有利于泡沫。

所以当 Jev 出来说,我们能不能干脆别让模型说话了,技术宅聚集的开发者社区就最早关注到了,发布当天,TypeSafe 的 API 一度被挤到瘫痪,它的发布帖,直接冲上了 Hacker News 的榜首,评论区一天就攒了密密麻麻几百条。

一半人在兴奋,另一半人在拆台。

3

Jev 解决问题的思路,简单粗暴……因为它底层就不是一个文字输出模型。

简单科普下,主流大模型是自回归的,像打字员,一个字一个字往外敲,最后给你唱长篇大论等等,记得最早ChatGPT的原理解读吧?四个字:单字接龙。

Jev 则是「不生成,只选择」——你给它一段状态,再给它一份选项清单,它直接返回你一个选项+一个概率值

翻来覆去,它就三种活。

从一列表格里挑一个,叫 Choice;给某个东西打个分,叫 Score;回答一个是或否,叫 Noul。

所有问题一次性并行算完,没有逐字推演那一步,所以快得离谱,端到端 70 到 500 毫秒,官方说比前沿大模型快 40 到 200 倍,独立实测的中位延迟大概在 300 毫秒上下。

价格上,输入每百万 token 才 0.042 美元,输出直接免费,摊到一次决策,成本大约 0.0004 美元——约等于不要钱。

TypeSafe 还拿它去打了 《DOOM》游戏,那种每秒要做差不多 10 次即时判断的场景,Jev 表现得像个反应极快的老玩家,整套推理成本一小时 7 美元左右。

打开网易新闻 查看精彩图片

但真正让开发者上头的,其实不是快,也不是便宜。

是它没法撒谎。

它的输出,被你提前定义好的格式死死锁住,格式错误在结构上就发生不了。你告诉它只有三个选项,它就只可能吐这三个。

不过得补一句,官方自己承认,这个「零幻觉」不是实测出来的,它保证的是格式,不是内容对错。

控制得住的错误,才叫错误,控制不住的,叫事故。

有人把 Jev 形容成 AI 原生的 if 语句——你用传统 if else 写不出来的模糊判断,交给它。

4

这玩意要这么靠谱,为什么现在才出现,这几天才火起来?以前咋没人弄?

答案是越来越吃 token 的各种 AI Agent爆发了。

一个完整的 Agent 任务,拆开看,是几十个特别微小的决定来判断这一步成没成,选工具 A 还是工具 B,从上一段输出里抠出一个关键字段,要不要中止流程,等等。

如果每个小动作,都要请那个千亿参数的大模型出山,延迟会一层层累加,成本会迅速失控,更致命的是,只要中间任何一步的 JSON 解析失败,整个 Agent 就卡死在半路上。

这就像公司里,上厕所都得走一遍董事会流程打报告,你会憋死。

可现实里的生产系统,绝大多数节点,本来就是普通的代码,代码不需要情绪价值,不需要排比句,它只需要一个特别便宜、特别快、绝对合规矩的决策信号。

所以 Jev 真正做的事,是在 AI 的系统架构里,插进了一层「前置反射弧」。

贵的大模型退到幕后,当那个慢思考的「系统二」,负责宏观规划。一线的脏活累活,工单分类、内容初筛、海量数据打标,交给 Jev 这种「系统一」模型,毫秒级搞定。

打开网易新闻 查看精彩图片

TypeSafe 用《思考,快与慢》给自己的整个品类命名,叫 System One Model。主流大模型卷了三年系统二,它偏要去做系统一。

如果模型是人,他们做的就是把大脑皮层的深思,和脊髓的条件反射,拆开来,各司其职。

5

理论收了不少,看看开发者实际拿它干了点啥。

下面这些都是开发者自己晒出来的账单,没经独立核实,权当参考。

有个哥们把 3282 条推文喂给 Jev,分析增长规律,400 多万 token,花了 0.1282 美元,耗时 8 分 34 秒。

有人拿它给 1018 篇论文做分类,总成本 0.08 美元,还有个开源浏览器 Agent 接上 Jev 去找机票,7 秒搞定,成本 0.0039 美元。

最接近我前面说的那种场景的,是客服。有人拿 Jev 做邮件分诊,让它判断一批用户邮件是咨询还是投诉、该转给哪个部门、要不要人工介入,1 秒多就过完一批,把拿不准的再转给更贵的大模型兜底,整条流水线准确率拉到 96%,总成本 0.07 美元。

还有人用它 40 秒拆解了 37 个品牌的 724 条实时广告,花了 9 美分。

有人做了个 Postgres 扩展,直接拿自然语言查数据库。甚至有人让它同时操控 Super Smash Bros 里的 4 个角色对打,一局也就几美分。

你看出这里面的味道了吗?

Jev 其实不是在抢大模型的饭碗,它是在给大模型当「门卫」,便宜的活它先干,贵的活再往上递。

6

但还是得泼盆冷水,就当开头说的,也有不少人在给它拆台。

它最大的阴影,是不再解释自己。

Jev 只给你一个选项和一个概率,没有理由,没有过程,比如在金融、医疗这些行业,一个没法被审计的决策,没法背锅,当然大模型也能未必能背锅,但其实能找到出错点。

再就是成绩单基本都是自己出的题。

那个「准确率 67.8%」看着接近头部,可翻到 TypeSafe 自己的评测页,Jev 只排第四,前头压着 GPT-5.6 Sol 的 74.1%、Claude Opus 5 的 73.1%,它追平的是中档模型。而且标准答案,是拿竞争对手的预测当裁判。

第三方独立测试也很少很窄,有人拿 10,984 条真实 A/B 去测,它判断对的只有 64.5%,换个没有真实差异的对照组,直接掉回随机水平。定价又低到像在烧 4000 万美元融资打价格战,至今却只是小范围内测,没有具名客户,也没披露收入。

把模型做小、做快、做确定,确实敲在了行业最疼的地方,但真实业务最刁钻的极端情况把它都跑痛一遍之前,说它颠覆了什么,早了点。

7

不过,就算带着这么些质疑,Jev 依然是很让人兴奋的一个 AI 产品。

过去几年,我们都在惊叹 AI 越来越会说漂亮话,尤其是R1给足你情绪价值后,大模型的评判标准似乎全是人类自己的样子,好像只要它够像人,就越强。

Jev 把这些规则都打破了,反问了一个特别朴素的问题——机器和机器之间,为什么非得说人话?

这让我想起那个给它命名的杰文斯悖论。1865 年,杰文斯盯着一台更省煤的蒸汽机,最后看见的,却是一个烧掉更多煤的世界。

我觉得TypeSafe 赌的是同一个剧本,当判断便宜到可以忽略不计,智能就会像水电一样,铺满所有的世界。

这个赌注能不能成,现在没人知道。

但它至少提醒了我们一件被热闹盖住的事——AI 的终极形态,可能从来都不是一个更会说话的机器人。

也许恰恰相反。是一个安静、廉价、从不废话、也从不撒谎的判断器,藏在你根本看不见的地方,一秒钟,替你做完一万个决定。