在连续三个项目栽跟头后,开发者 deghosal-2026 得出一个反直觉的结论:模拟智能体会撒谎。单元测试通过、演示看似完美,一旦真实智能体投入运行,问题便集中爆发。他坦言,此前的评估框架中,字段测试是在构建后期临时加入的,因为他开始担心单元测试和模拟智能体掩盖了真正的集成问题;而在可观测性工具项目中,他一度误判为检测器故障。 这一次,他采取了截然相反的路线:完全放弃模拟智能体,改用 10 个框架下的 83 个真实智能体进行验证。通过覆盖设计,原本需要 12 天的测试矩阵被压缩到一个下午完成。同时设置发布门禁:真实智能体未证明策略有效之前,不允许发布。 结果是 2,490 项测试全部通过,83 个智能体全部达标,PyPI 包已发布,代码仓库也已公开。但更值得关注的是 7 个失败用例——它们带来的教训是其他方式无法获取的。 这一项目的核心判断是:AI 智能体的权限现状令人担忧。当前大多数智能体权限是二元的——允许或拒绝。但这只是可达性,而非真正的授权。同一工具在预发环境无害,在生产环境可能致命;同一读取操作对公开文档没有风险,对客户数据却可能造成泄露;CI 沙箱中的删除与生产环境中的删除不可同日而语。 他引用的数据进一步佐证了问题的普遍性:约 18% 的 MCP 服务器部署实现了任何形式的访问范围控制;80% 的组织承认智能体曾执行超出预期范围的操作;OWASP 已将智能体工具滥用列为一等风险。 在他看来,给智能体工具本身并不难,难的是决定它在什么场景、什么位置、什么护栏下可以使用。因此,在动手编写引擎代码之前,他先撰写了 PRD 和架构规范——部分是为了约束自己,部分是因为过去的教训表明,跳过设计环节往往会导致交付错误的产品。 Agent ToolTrust 正是一个基于上下文的风险权限系统——它试图回答的问题不是“智能体能否使用某把工具”,而是“这把工具该不该在此时、此地、以这种方式被使用”。

打开网易新闻 查看精彩图片