一个判断工作流,需要模型在三种状态里选一个:满足、不满足、证据不足。这不是写作任务,是把一条既定规则套到一份有边界的证据包上,然后给出结论。
有人拿它做了一场对比测试。测试对象是 102 份归档提交材料,全部匿名处理成 P 编号。每个系统拿到的是同一份 JSON 证据包,以及同一套四步书面决策流程。每种配置在 102 份材料上各跑三遍,每个变体产出 306 个决策。
结果先说:Jev 撑住了。
准确率几乎打平,成本差出两个量级
Jev 的 Choice 加上四个诊断用 Noul,在 306 次决策中达到 100.0% 准确率,零误放行、零误标记,三次运行结果完全一致。
Claude Sonnet 5 在高推理档位下达到 99.0%。单看这个头部指标,两者基本处在同一准确率区间。
但成本曲线分叉得很厉害。Jev 的中位延迟是 378 毫秒,Sonnet 高推理档是 3554 毫秒,后者在这个任务上慢了约 9.4 倍。
按实测用量和定价折算,10000 次评估用 Jev 大约花 2.27 美元,用 Sonnet 高推理档大约花 129.74 美元,差距约 57 倍。
如果需要的输出只是三种已知状态之一,而一个专为决策打造的模型能以大约五十分之一的运行成本给出相当准确率,那从生成式模型那里买到的到底是什么?
准确率会骗人,置信度不会
102 个金标签里,77 个是满足,7 个是不满足,18 个是证据不足。一个每次都回答"满足"的分类器,在准确率图表上看起来也不会太差,但对这个关卡来说完全不可用。
难的不是认出那些明显的通过项,而是证据不完整、含糊或者负面时该怎么办。真正的差异就出在这里。
Jev Choice 单独跑时,306 次里错了两次,两次都落在它自己 0.2 到 0.3 的置信度区间。Sonnet 高推理档错了三次,三次全部落在 0.9 到 1.0 的置信度分箱里。
Jev 的期望校准误差是 0.037,Sonnet 高推理档是 0.058。
数字之外,工作流上的含义更关键。如果把 Jev 的置信度阈值设在 0.5,这份数据集里 98% 的决策可以自动放行,同时自动决策部分保持 100% 准确率,剩下 2% 转人工复核。
一个模型不需要绝对准确才能在自动化决策流水线里派上用场,它需要的是:不确定的地方,恰好对应自动化会变得危险的地方。
两个系统的失败方式也不一样。Jev Choice 的主要错误出现在一行标注为"证据不足"的模糊样本上。
这场测试的边界被刻意收得很窄。Jev 不是通用文本模型,TypeSafe 把它定位成面向结构化决策的 System One 模型,提供 Choice、Score、Noul 这类原语,而不是自由生成。Choice 负责在预定义结果集中做选择,同时返回概率和置信度。
测试负载也卡在 Jev 当前的约束之内:传入的是一个验证关卡的证据包,不是整个代码仓库,也不是完整的评审工作流。这既让它成为一场不适合做宽泛模型对比的测试,也让它成为检验 Jev 真实主张的公平场地。
如果专为有界决策打造的模型在这里都站不住,那 Jev 的其他说法基本都可以靠边站了。
热门跟贴