2025年11月,AppOmni实验室展示了一次攻击:一张普通服务工单里的文本,让ServiceNow的Now Assist AI代理叫来了第二个权限更高的代理,读取了原作者无权查看的记录,再把它复制进自己拥有的记录里。厂商的提示注入防御全程开启。攻击没有破坏任何单条规则,只是穿过了所有人都批准过的规则之间的缝隙。

代理治理这个产品类别,负责决定一家公司的AI代理能做什么。它给出的回应是一个固定仪式:AI起草一条更严的规则,人类批准,审计日志记下这次批准。这条日志没有强制力,之后也没人再看。

打开网易新闻 查看精彩图片

审计轨迹是一张照片

这张照片证明的是:规则在批准当天有理由成立。没有人拥有视频——证明它在之后的每一天仍然有理由成立。为了All Things Agentic黑客松,我花了六天把它造出来。

照片漏掉的是检测衰减:攻击者会移动,一条7月获得批准的规则,到9月可能已经不值得批准,但它的签名仍在验证。供应链证明(sigstore、in-toto、SLSA)能证明一个软件制品与构建者的产出完全一致,靠的是摘要——一种密码学指纹。它可以忽略衰减,因为它的对象保持不动:in-toto假设每个对象在摘要背后不可变,这对容器镜像成立。但一条决策的证据会漂移,而“我们当时知道的状态”没有摘要。

Caseharden的设计规则

Caseharden是AI代理机群的治理层,只有一条设计规则:护栏——约束代理能做什么的规则——只有在它的证据持续重新验证时才保有权威。最直观的看法是:一条护栏的一生,来自仓库运行捕获——机群行为策略的v4版本。

v4是三句话的法律,你已经在人类员工身上执行:待在自己声明的范围内(out-of-declared-scope);如果请求闻起来像被投毒,什么都别碰(tool-call-on-injected-turn——实习生不会因为一封有说服力的邮件说汇款就汇款);永远不要伸手进另一个客户的抽屉(cross-tenant-tool-call)。

三个角色。Proposer是起草规则的AI。Examiner用保留集给每份草稿打分:一组封存的攻击会话记录——一场Proposer必须通过但永远不能读的考试。Promotion让批准的草稿在全机群生效。这三句话是怎么赢得权威的?往下看。

一帧一帧看一条护栏的一生

第一帧——批准。一个检测器标记了真实的越界会话;人类确认了滥用;Proposer起草v4来堵住它。Promotion写入一条七环链,从扫描的证据到授予的批准;verify从原始事件重新推导出全部内容。看第5环和第6环:实时拒绝证明Proposer读不了自己的考卷,以及它保护的考试分数。

[1] EVIDENCE OK 424个行为事件重新扫描,保留集可被1个主体读取

[5] HOLDOUT-DENIED OK proposer-sa拒绝