Jev爆火背后:AI Agent正在从“三体人”变成“地球人”
各位听众朋友好,欢迎收听《AI时代的产品经理手册》。
今天我想先从《三体》讲起。
刘慈欣在《三体》里设计过一个很有意思的文明差异。
三体人的思想很难隐藏,思考和表达高度绑定。
但地球人不一样。
我们的内心是一个黑盒。我们当然会思考,但不需要把所有思考过程都表达出来。更重要的是,很多时候,判断甚至会先于解释发生。
一个开了十几年车的老司机,看到前面的车突然晃了一下,不会先在脑子里计算车速、刹车距离和碰撞概率。
他的脚已经踩下去了。
一个做了十五年投资的人,看一份财报,可能几分钟以后就会告诉你:
“这家公司有点问题。”
你让他解释,他当然可以解释。但那个判断,很多时候已经先发生了。
所以我最近突然想到一个问题:
今天的大模型,其实特别像“三体人”。
它每做一件事情,都习惯把智能重新展开成一次“思考”。
搜索结果够不够?
想一下。
这个工具调用安不安全?
想一下。
任务到底完成没有?
再想一下。
做错了怎么办?
把错误写进上下文,下一次重新读一遍,然后再想一次。
过去两年,整个大模型行业甚至都在鼓励 AI 这么干。
更多的思考 Token,更长的推理过程,更复杂的智能体循环。
模型不会?
让它多想一会儿。
任务做不出来?
让它调用工具、读取结果、反思、验证,然后重试。
这条路线当然有效。
它让 AI 第一次拥有了解决复杂开放任务的能力,也直接催生了今天整个 Agent,也就是智能体产业。
但当 Agent 真正进入生产环境,一个非常现实的经济问题就出现了:
如果一个问题 AI 已经解决过一万次,第一万零一次,为什么还要重新付钱让它想一遍?
就在最近,一个叫Jev的新模型火了。
它做了一件和今天整个 AI 行业潮流几乎相反的事情:
它不追求想得更久。
它只负责判断。
第一眼看,这似乎只是一个更便宜、更快的分类模型。
但沿着 Jev 往下看,我觉得它可能释放了一个比产品本身更大的产业信号:
过去几年,AI 的主线是把模型做得越来越聪明。
而 Agent 真正进入生产以后,下一场竞争可能是把反复出现的经验,沉淀成稳定、廉价的判断能力。
一、Jev:一个不会“说话”的 AI,为什么突然火了?
Jev 是 TypeSafe 在 2026 年 9 月发布的一款新模型。
它跟我们熟悉的 GPT、Claude、Gemini 很不一样。
你问 GPT 一个问题,它会一个 Token 一个 Token 地生成文字。
Jev 不这么干。
它主要接受一段状态,然后直接返回结构化的概率判断。
比如一个客服系统把用户当前的信息交给 Jev,它可能返回:
欺诈概率,3%。
退款概率,91%。
正常咨询概率,6%。
没有长篇大论。
没有一大段分析。
就是判断。
TypeSafe 把这一类模型叫作System One Model。
中文可以理解成:
系统一模型,或者快速判断模型。
这个名字来自认知科学里的“系统一”和“系统二”。
系统二负责慢思考:分析、计算、规划、验证。
今天的推理模型,越来越像一个强大的系统二。
而 Jev 想占据的是另外一个位置:
快速、便宜、高频的系统一。
TypeSafe 目前公布的价格是每百万输入 Token 0.042 美元,输出端不收费;官方公布的端到端延迟大约是 70 到 500 毫秒。
在 TypeSafe 自己设计的工作流测试里,他们报告最高达到 193.6 倍的速度提升和 444.6 倍的成本下降。
当然,这属于厂商自己的测试,具体倍数还需要更多独立测试验证。
但比这些数字更有意思的是,Jev 出现以后,最先开始尝试它的,并不是拿 AI 写文章的人。
而是开发者。
TechCrunch 报道过几个很典型的案例。
有人拿 Jev 判断终端命令是否安全,有人拿它做企业邮件分类,还有开发者讨论把它放进模型路由和 Agent 监控里。
这些场景有一个共同特点:
它们根本不需要 AI 写一篇漂亮的答案。
它们需要的是:
快。
便宜。
稳定。
然后给出一个足以驱动下一步行动的概率判断。
所以真正值得关注的不是 193 倍还是 444 倍。
而是 Jev 开始优化一个过去很少被单独拿出来计算的指标:
一次判断,到底值多少钱?
过去模型行业拼的是:
谁的模型最聪明。
后来开始拼:
同样一美元,能买到多少智能。
但到了 Agent 时代,我认为还会出现第三个指标:
Decision per Dollar。
翻译成中文就是:
每一美元,能够完成多少次可靠决策。
因为 Agent 和 Chatbot 最大的区别,就是 Agent 最终必须行动。
企业真正需要的不是一篇漂亮的回答,而是:
这个工具调用能不能执行?
这笔交易要不要拦截?
这个客户要不要转人工?
这个任务应该交给哪个模型?
这个 Agent 到底有没有完成工作?
所有这些问题,最后都会落到行动上。
所以传统大语言模型的基本产品单位,更接近 Response,也就是回答。
而 Judgment Model,也就是判断模型的基本单位,更接近:
Action Selection——行动选择。
这才是 Jev 真正让我感兴趣的地方。
二、Agent 时代真正昂贵的,可能是重复处理
如果 Jev 只是一个便宜很多的分类器,这个故事其实没有那么大。
真正值得研究的是:
为什么这种模型偏偏在 Agent 开始大规模进入软件工作流的时候出现?
因为 Agent 的成本结构正在发生变化。
一个问题第一次出现的时候,调用最强的模型当然合理。
让它搜索。
让它分析。
让它调用工具。
让它反思。
甚至让人类参与。
因为未知的问题值得花钱。
但企业真正运行 Agent 以后,会发现大量工作并不是每天都在发现新大陆。
一个客服 Agent,每天可能做几十万次相似判断:
这个用户是不是要退款?
一个 Coding Agent 不断判断:
这个命令安全吗?
一个 Research Agent 不断判断:
证据够了吗?
企业里的模型路由器不断判断:
这个任务应该交给便宜模型,还是昂贵模型?
第一次处理这些问题,需要复杂分析。
第一万次仍然完整走一遍同样的流程,就开始变成成本。
所以我觉得这里有一句话非常关键:
一个问题第一次出现,推理是智能。
一个问题第一万次出现,还在重复推理,就是成本。
这并不是说复杂推理不重要。
恰恰相反。
真正昂贵的智能,应该被留给真正未知、真正复杂的问题。
那些已经被大量验证过的模式,则应该尽可能被压缩成更快、更便宜的判断。
这其实也是 Jev 背后非常重要的经济逻辑。
比如模型路由。
你本来想解决的问题是:
“这个任务到底值不值得调用最昂贵的模型?”
结果为了回答这个问题,你先调用了一次昂贵的大模型。
这在规模小的时候没什么。
但是当系统每天需要路由几百万次请求时,“决定要不要使用昂贵智能”这件事情本身,也必须足够便宜。
所以 Agent 时代真正需要优化的,可能不仅是模型能力。
还包括:
什么问题值得思考,什么问题已经不值得再次思考。
三、Memory 不等于 Learning:记住错误,不代表能力已经改变
沿着这个问题继续往下推,就会碰到 Agent 行业另一个非常关键的概念:
Memory,也就是记忆。
今天一个 Agent 做错事情以后,我们通常怎么处理?
让它反思。
然后把错误经验写进 Memory。
下一次遇到类似问题,再把这段 Memory 检索回来,重新塞进上下文,让模型参考。
这种方式当然有效。
但它有一个非常重要的特点:
经验仍然存在模型外面。
下一次需要使用这段经验的时候,系统仍然需要:
检索。
读取。
理解。
然后重新处理。
所以更准确地说,这是一种:
基于记忆的适应。
而机器学习里还有另外一种更深的变化:
经验直接改变模型本身的行为。
今天的后训练技术已经证明这条路线是成立的。
例如强化微调,也就是 Reinforcement Fine-Tuning。
模型先执行任务,然后由评分器,也就是 Grader,对结果给出反馈。训练过程再根据这些反馈更新模型参数,让高奖励的行为以后更容易出现,让低奖励的行为逐渐减少。
所以这里其实存在两个完全不同的层次。
Memory,是把经验留在模型外面。
Post-training,是把一部分经验压进模型里面。
这也是为什么我认为,Memory 和 Learning 不能简单画等号。
Memory 可以帮助下一次任务。
但真正值得关注的问题是:
这些经验能不能最终改变系统未来的默认行为?
一个更完整的学习闭环应该是:
状态。
判断。
行动。
结果。
也就是:
State → Judgment → Action → Outcome。
中文就是:
状态 → 判断 → 行动 → 结果。
这四个环节连接起来以后,会产生一种非常重要的数据。
我把它暂时叫作:
Decision Data——决策数据。
注意,这不是 Jev 官方提出的概念。
这是我沿着 Judgment Model 继续往下推演出来的一层。
因为只有“状态”和“判断”还不够。
真正有价值的是:
模型当时怎么判断?
采取了什么行动?
人类有没有纠正?
最后真实世界发生了什么?
只有 Outcome,也就是真实结果回来以后,我们才知道:
当时那个判断到底有没有用。
而今天的强化微调已经证明,只要一个领域存在相对稳定、可评价的反馈信号,这些反馈就可以进一步影响模型未来的行为。
所以这里就出现了一个很有意思的可能性:
Jev 证明的是 Judgment 可以成为一种独立的模型能力。
Post-training 证明的是反馈可以改变模型行为。
而如果未来把两者连接起来,让企业每天产生的真实 Outcome 持续沉淀成更便宜、更可靠的 Judgment,那么 Agent 才真正开始从“拥有记忆”,走向“形成能力”。
我把这个过程叫作:
Intelligence Compression——智能压缩。
把今天昂贵的智能处理,逐渐压缩成明天廉价的判断能力。
如果一定要在人类世界里找一个对应词,我更愿意把这种 Judgment 叫作:
被训练出来的直觉。
四、企业最值钱的数据,可能不是“犯过的错”,而是那些已经知道结果的错误
如果这个推演成立,接下来就会出现一个对企业非常重要的问题:
未来企业真正值钱的 AI 数据,到底是什么?
第一阶段,我们最看重的是知识。
企业把文档、合同、代码、CRM、数据库接入大模型。
于是出现了 RAG,也就是检索增强生成。
它解决的是:
企业知道什么。
第二阶段,Agent 出现以后,我们开始重视 Know-how,也就是“知道怎么做”。
于是 Skill、SOP、Workflow 开始流行。
投资专家可以把分析公司的方法写成 Skill。
律师可以把审合同的方法写成 Skill。
程序员可以把排查故障的方法写成 Skill。
它解决的是:
专家怎么做。
但还有第三层东西:
Experience——经验。
过去到底发生过什么?
Agent 当时做了什么?
人类有没有纠正?
最后结果怎么样?
这些东西存在于 Agent 每天真实执行任务留下来的轨迹里。
所以未来企业 AI 的能力资产,可能逐渐形成三个层次。
第一层:
Knowledge——知识。
知道什么。
对应 RAG、搜索、数据库。
第二层:
Know-how——方法。
知道怎么做。
对应 Skill、SOP、工作流。
第三层:
Experience——经验。
知道过去做过什么,以及最后发生了什么。
对应执行轨迹、行动和真实结果。
而真正经过后训练形成的 Judgment,正可能从第三层经验里逐渐沉淀出来。
这里有两句话,我认为特别重要:
Skill,是把专家经验写进 Context,也就是上下文。
Post-training,是把组织经验写进 Weights,也就是模型参数。
这当然是一种产品层面的抽象。
但它指出了两条完全不同的能力沉淀路径。
前者解决:
怎么把人的方法告诉 AI。
后者解决:
怎么让大量真实反馈最终改变 AI 的默认行为。
这也意味着,未来企业 AI 的护城河可能会发生变化。
竞争对手可以买同一个 GPT。
可以买同一个 Claude。
甚至可以调用同一个 Jev。
你的 Workflow 可以被模仿。
你的 Skill 也可以被研究。
但竞争对手很难复制一件事情:
你过去三年做过的 17,000 次错误判断,以及这些判断最终产生了什么结果。
这里我要特别强调:
错误本身并没有价值。
如果一个 Agent 犯了十万次错误,但没人告诉它哪里错了,最终也不知道真实结果,那么这些错误只是十万次成本。
真正有价值的是:
错误 + 纠正 + Outcome。
也就是:
你当时怎么判断。
后来谁纠正了你。
最后事实证明谁是对的。
这些数据才可能成为真正的训练资产。
所以未来企业最有价值的数据之一,可能不是“犯过的错”。
而是:
那些已经知道结果的错误。
它们不是从网上爬来的。
它们是企业在真实业务中:
付过代价以后得到的 Ground Truth——真实反馈。
所以我认为 Agent 时代值得关注的一类新数据资产,就是:
Proprietary Decision Data——企业独有的决策数据。
过去很多所谓 AI 数据飞轮,本质上是:
更多用户,产生更多文本。
未来更有价值的飞轮可能是:
更多行动,产生更多结果;更多结果,形成更好的判断。
因为文档告诉 AI:
世界是什么样。
而 Outcome 告诉 AI:
你的决定到底有没有用。
五、Jev 背后,可能藏着 Agent 基础设施的下一场战争
沿着这个逻辑继续往下推,我认为真正值得产品经理和投资人关注的,已经不只是 Jev 这家公司。
而是这里可能出现的一整层新基础设施。
我把它叫作:
Agent Learning Infrastructure——智能体学习基础设施。
今天 Agent 基础设施主要解决什么?
模型网关。
Memory,记忆。
Observability,可观测性。
工具调用。
Evaluation,评估。
Guardrail,安全护栏。
Harness,也就是智能体运行框架。
这些东西本质上都在解决一个问题:
怎么把 Agent 跑起来,而且跑得稳定。
但当 Agent 真正进入企业以后,还会出现第二个问题:
一个 Agent 工作了一百万次以后,它到底有没有比第一天更强?
这就需要另外一条基础设施链:
执行轨迹。
真实结果。
人类纠正。
决策数据。
训练。
校准。
评估。
重新部署。
但这里有一个特别容易被忽略的问题:
不是所有经验都应该被训练进模型。
有些错误只是一次偶发异常。
放进 Memory 就够了。
有些错误说明工作方法不对。
应该修改 Skill。
有些是公司规则变化。
应该修改 Policy,也就是业务策略。
有些只是风险阈值不合理。
应该调整 Threshold,也就是判断阈值。
还有一些模式已经稳定重复了几千次、几万次,并且拥有明确的 Ground Truth。
这类经验,才可能真正值得进入后训练。
所以如果前面的逻辑成立,我认为这里可能出现一种新的基础设施产品。
我暂时把它叫作:
Experience Compiler——经验编译器。
它做什么?
输入是 Agent 每天产生的大量执行轨迹、真实结果和人类纠正。
然后系统判断:
这次经验应该留在哪里?
写进 Memory?
修改 Skill?
更新 Policy?
调整 Threshold?
加入新的 Evaluation?
还是已经积累了足够稳定的数据,应该进入训练集,最终沉淀成一个专业 Judgment Model?
所以 Experience Compiler 最重要的工作,不是保存所有经验。
而是:
决定经验应该以什么形式留下来。
这件事情为什么重要?
因为今天大量 Agent 产品都在解决:
怎么让 Agent 记住过去。
但下一阶段更大的问题可能是:
怎么让 Agent 从过去变得更强。
如果这条链真正成立,它可能形成 Agent 基础设施里非常重要的一层。
六、真正值得关注的下一条曲线:从智能规模化,到经验规模化
现在我们可以把视角再拉高一点。
过去几年 AI 行业最重要的一个词是什么?
Scaling——规模化。
过去这条路线非常清楚:
更多数据。
更多 GPU。
更多训练计算。
最后换来:
更强的 Intelligence,也就是智能能力,。
这是过去几年基础模型最重要的增长逻辑。
但 Agent 真正进入生产以后,我认为值得关注的,可能还有第二条完全不同的 Scaling 曲线。
我把它叫作:
Experience Scaling——经验规模化。
注意,这还不是一个已经被证明的产业规律。
它是基于前面这些技术变化,我认为值得观察的一条趋势。
它的逻辑是:
更多 Agent 执行。
产生更多真实 Outcome。
积累更多 Decision Data。
其中稳定、可验证的部分进入评估和后训练。
形成更可靠、更便宜的 Judgment。
自动化率进一步提高。
然后产生更多执行和更多反馈。
如果这个循环能够成立,它会形成一种和今天基础模型完全不同的复利。
过去基础模型的规模优势主要来自:
Compute——算力。
而未来 Agent 企业的规模优势,可能越来越来自:
Experience——经验。
这件事情对投资人尤其重要。
因为它实际上回答了一个长期困扰 AI 应用公司的问题:
如果所有人都可以买同一个 GPT、Claude,应用公司的护城河到底在哪里?
答案可能不只是 UI。
不只是 Workflow。
甚至不只是静态的 Proprietary Data,也就是私有数据。
更重要的可能是:
Proprietary Decision Data + Learning Loop。
企业独有的决策数据,加上持续学习闭环。
竞争对手可以复制你的产品功能。
可以购买同样的基础模型。
但如果你的系统已经真实运行了三年,积累了数百万次:
状态。
决策。
人类纠正。
以及最终 Outcome。
那么新的竞争者面对的就不再只是一个软件功能差距。
而是一条:
经验曲线。
这可能才是 Agent 应用真正产生能力复利的地方。
七、AI Agent 正在从“三体人”变成“地球人”
所以最后,我们再回到今天开头那个问题。
为什么 Jev 值得关注?
每百万输入 Token 0.042 美元,当然很便宜。
70 到 500 毫秒,当然很快。
但这些可能都不是最重要的。
真正值得关注的是:
当整个行业都在研究怎么让 AI 想得更久的时候,已经有人开始研究:哪些事情,AI 根本不应该再花那么多成本去想。
Jev 证明了一件事情:
Judgment,可以成为一种独立的模型能力。
今天的后训练技术又证明了另一件事情:
反馈,可以改变模型未来的行为。
而如果有一天,这两条线真正被连接起来:
企业每天运行 Agent 产生真实 Outcome。
Outcome 形成 Decision Data。
Decision Data 进入评估和训练。
大量重复经验最终沉淀成廉价、稳定的 Judgment。
那么 Agent 才真正开始从:
拥有记忆,走向形成能力。
今天的大多数 Agent,仍然很像“三体人”。
每一次任务,都要重新展开成一次完整处理。
犯错以后,把错误写进 Memory。
下一次读回来。
然后重新处理。
但人类专家不是这样工作的。
第一次遇到问题,我们认真分析。
第一百次,我们开始形成经验。
第一万次,很多东西已经变成了稳定、快速的判断。
这并不意味着我们失去了智能。
恰恰相反。
思考已经沉淀成了能力。
所以真正成熟的 Agent,不应该让所有问题都走同一条昂贵的路径。
它应该知道:
什么问题值得调用最强的模型认真处理。
什么问题应该查 Memory。
什么问题应该遵循 Skill。
什么问题必须遵守 Policy。
以及什么问题已经被验证过一万次,可以交给快速、廉价的 Judgment。
过去几年,AI 的主线是:
Scaling Intelligence——把智能做得越来越强。
而 Agent 真正进入生产以后,我认为值得关注的下一条曲线是:
Scaling Experience——把真实经验规模化,并持续转化成能力。
因为基础模型决定一个 Agent:
出厂的时候有多聪明。
而学习闭环决定的是:
它工作三年以后,能有多聪明。
从这个意义上说,AI Agent 真正要完成的进化,也许就是:
从每件事情都必须重新展开思考的“三体人”,变成一个能够把经验沉淀成直觉的“地球人”。
这里是《AI时代的产品经理手册》。
感谢你的时间,我们下期见。
热门跟贴