一个 AI 请求语法完全正确,某个智能体还主动重试成功,一看账面,服务错误率低得漂亮。但打开产品,要么成本爆表,要么细节跑偏,肉眼可见地不对劲。

这就是“Agent 系统”的失败模式:传统应用看错误率就够了,Agent 链路上一个节点自行补救,整体表象依然正常,可实际交付的东西已经悄悄变了质。真正该问的问题不是“服务挂了没”,而是“这一趟运行里,在哪个阶段出了什么岔子,接下来该往哪查”。

打开网易新闻 查看精彩图片

Faultline 就是围着这个核心问题长出来的一个小型运维控制台。它运行一套兼容 OpenAI 的移动应用生成工作流,把生成的产物用 Expo 渲染成可跑的 App,并把自部署的 SigNoz 作为唯一的可观测后端。不用再造一个通用大盘。

Faultline 的产品边界很明确:它不是来和 SigNoz 抢仪表盘的。SigNoz 原本的仪表盘、Trace 查看器、日志浏览器、告警面板已经够强,在 Demo 里照搬只会制造噪音。Faultline 真正“拿来就用”的,是一套专门针对 Agent 链路的调查流水线——

  • 先找到一次值得深挖的运行记录;
  • 沿着因果路径一路追溯;
  • 定位出有问题的那个 Agent;
  • 直接读取它真正用到的提示词、模型输出、重试上下文和生成的产物;
  • 如果还需要原始证据,一键跳转进对应的 SigNoz Trace、日志或告警。

运行引擎本身也刻意做得小巧。整个工作流只包含几个固定角色:Planner、Architecture、Design system 和 Primary screen。一次运行启动后,结构立刻写进内存,然后后台异步执行。这样一来,控制台拿到的不是最后才返回的空转圈,而是一份实时更新的“活状态”——Agent 还没跑完,UI 已经能区分“正在等前一个阶段”“工作区已启动”“正在重试”“模型响应已收到”“产物已写出”这些清晰的执行事件。

最关键的一点:对 Agent 调试最有价值的上下文,绝不是一张 Token 消耗图,而是那次请求到底用了什么系统指令、任务提示词,模型返回了什么,做了哪些决策,才最终产出了眼前那个产物。Faultline 把这套“运行卷宗”留在运行记录里,同时以结构化日志的形式送进 SigNoz。控制台用本地卷宗做即时渲染,SigNoz 则负责长期可追溯的遥测存储。两者不打架,也不用再加一套新遥测工具。

哪个 Agent 的详情被选中,接口直接暴露规格化的信息:系统指令、任务提示词、输出、产物、事件记录,以及对应的 Trace ID 和 Span ID。证据部分被打包成胶囊——Trace 胶囊、日志胶囊和风险胶囊——不额外暴露 SigNoz 的查询语言,也屏蔽掉通用大盘控件,只把调查中最需要的实体推给使用者。