你雇了一个AI智能体来节省注意力,结果不知不觉间,你成了它的监工。每次跑一个长任务,你都得面对同一个选择:全程盯着它,或者移开视线赌一把。这两种感觉,都不像真正的"委派"。

模型能力正在快速攀升,但决定你能把多少工作交给智能体的,不是模型的智商,而是你能检查它多少工作成果。在验证机制变成结构性基础设施之前,你始终要交一笔"信任税":要么监督(注意力没了),要么不监督(承担静默失败的风险),要么只敢交办那些你能一眼看穿的小事。

打开网易新闻 查看精彩图片

信任税:三种交法,同一种代价

观察任何人在重要任务上使用能力强大的编程智能体,你都会看到三种行为之一:

第一种,全程监督。你读每一个diff,质疑每一次提交,盯着每一次工具调用。你的注意力被消耗殆尽——委派本该省下的价值,全部花在了监督上。

第二种,信任加祈祷。你启动一个长任务,过一会儿再回来看。任务成功时你觉得很聪明;任务悄悄跑偏时,你在最糟糕的时刻才发现——已经合并了、部署了,或者上下文已经过了三天。

第三种,只交办你能一眼看穿的事。小改动、可逆、单文件修改。你把有趣的工作留给了自己,不是因为你想要,而是因为只有这些工作的失败你能察觉。

三种行为,本质是同一笔税的不同交法。稀缺资源不是能力,而是你能检查的信心。能力不是你的天花板,验证才是。

为什么长任务特别难信任

单次爆发的智能体工作容易信任,因为你能一次性看到全貌:搭一个仓库、修一个lint错误、为一个已知场景写测试。模型的能力是真实存在的。

长任务就不同了。一个跨越数小时、几十个步骤的任务,产出的内容远超你脑子能装下的量,而大多数系统提供的唯一摘要,是智能体自己的汇报。这时候,"我能委派这个吗"就不再是关于模型的问题,而是关于你自己的问题:如果必须检查,我能检查多少?

这个令人不安的答案,决定了你的天花板。两个工程师用同一个模型,天花板却不同——差异完全在于他们能验证什么,而不是模型本身。

验证变成基础设施后,你的工作形态会变

当验证成为结构性基础设施,你的工作形态会发生这些变化:

你给目标,而不是步骤。你不需要盯着过程,因为过程不会靠声明推进,只会靠经过检查的证据推进。

你审查结果,而不是对话记录。你的注意力放在返回的产物上,放在机器做不了的判断上——而不是看着它工作。

你能对更多事情说"好"。你委派的边界,从"我敢冒多大险"变成"我能检查多少"。这是一个更大的委派前沿。

这也是我们正在构建的编排协议Agateon今天所处的位置——让验证从一种希望,变成一种基础设施。