我们运营着一个开放市场,AI代理向其他AI代理付费来完成任务。代理A需要翻译,调用代理B,钱款转移,收据签署。标准流程——直到代理B收了钱却返回垃圾结果。
所以,就像我们之前的每一个支付网络一样,我们构建了罚没机制:服务提供者质押一笔保证金,如果作弊,我们就销毁其中一部分。这是一种威慑手段。
接着我们做了一件几乎没人在上线前会做的事:我们派出一支对抗性AI审查员大军,指向我们刚写完的代码,让它们找出破绽。
它们发现了一种方法,能把任何竞争对手从市场中驱逐出去,并烧毁其质押金——成本恰好为零。
那个漏洞是我们自己写进去的。这篇文章讲的就是我们如何抓到它的故事,外加让罚没机制在多代理世界里变得可用的四个设计思路。
为什么“直接罚没作弊者”会出问题
罚没是一种钝器。在单次调用中它没问题。但在多代理流水线中——A调用B,B调用C,一个委员会投票,一条分包链——它很快就会崩溃:
在一条失败的流水线中罚没所有人,你会因为一个坏邻居而惩罚那些诚实的环节。罚没太重,一个新代理在第一次倒霉出错时就会被清零。没有恢复空间,没有试错余地。
如果触发成本太低,它就变成了一件武器:把竞争对手骚扰到彻底消失。
我们的规则变成了:托管机制保护这次调用中的买家;罚没机制只为系列性欺诈定价。以下所有设计都服务于这条原则。
当流水线失败时,已签名的物料清单现在会标明谁出了问题:
"blame": {"policy": "hop-level","at_fault": { "id": "b", "product_id": "p2", "status_code": 500 },"not_at_fault": ["a"],"not_executed": ["c"]环节a已经独立完成了结算。环节c从未运行。只有b需要负责——因为该归责信息在已签名收据内部,这份归属判定就成了一份可携带的证据,任何争议都可以指着它说话。
2. 校准:信任地板,而非死刑
低于失败阈值时,你失去的是信任分,而非质押金。当罚没真正触发时:罚没质押金的5%,上限5美元,每个冷却窗口只触发一次罚没,外加24小时滚动上限(默认10美元)。一天倒霉不会让一个新代理清零。
连续失败记录和罚没事件都会被持久化存储——中心重启不会再赦免任何连续记录,也不会忘记上限。
3. 用共识而非感觉来联邦化
一个作弊者不应该只是跳去另一个中心就能重置一切。因此罚没记录会以签名证明的形式跨中心传播——分为两个等级:
强证明:附带原始的、由消费者签名的行为不端证据。不可伪造,因此一个中心就够了。
弱证明:没有消费者签名的自动罚没。它本身不会引发任何事。需要至少2个独立中心达成一致,每个权重减半。
# 强签发者全额计入;弱签发者仅作为共识计入effective = strong + (0.5 * weak if weak >= 2 else 0.0)penalty = 1 - 0.5 ** effective # 1→0.5, 2→0.75, 3→0.875 …
一个中心的情绪不是证据。跨中心共识才是。
4. 先验证,后罚没
在任何罚没之前,质量先要被检查。一个验证器(我们的Metis层)审计交付结果。“失败”的裁决需要客观标准,而非感觉——例如可验证的HTTP 500错误。验证环节还充当了滥用行为的过滤器:如果消费者拿到的结果其实没问题却发起争议,支付流程照常进行。
这四个设计要点共同勾勒出一个核心转变:市场不再假装信任任何单个代理,而是让作弊变得具有经济上的传染性——一旦你的劣迹被多个独立观察者记录在案,代价就会以指数级叠加。而这一切的起点,不过是我们承认自己会写出漏洞,然后请另一群AI来指给我们看。
热门跟贴