调试是发现并修复错误的过程。在软件工程中,这一步已经足够关键,而在智能体工程里,它的重要性还要更高。LangSmith 的核心能力之一,就是为 LLM 应用提供调试工具。
现在,LangSmith 正在进一步解决新一代“深度智能体”带来的调试难题。这类智能体与简单的 LLM 调用或短工作流不同,它们会运行数分钟,跨越几十甚至几百个步骤,并且经常需要与用户进行多次来回交互。
深度智能体为什么更难调试
一次深度智能体的执行会产生大量追踪信息,信息量远超人工快速浏览和推理的范围。当出现问题时,很难直接判断是哪一个决策、哪一条提示指令或哪一次工具调用导致了当前行为。
这正是使用 LangSmith 进行追踪,并借助 AI 分析这些追踪数据变得重要的原因。要调试一个智能体,首先需要看清它内部发生了什么,而追踪就是实现这一可见性的方式。
LangSmith 用“追踪”来统称将智能体执行数据记录到平台的过程。数据格式由 runs、traces 和 threads 组成。追踪的设置非常简单,按照指南操作,几分钟内就能完成。
用 Polly 分析完整智能体轨迹
当应用数据进入 LangSmith 后,就可以利用 AI 分析完整的智能体运行轨迹,弄清楚发生了什么,并据此提出提示词更新建议。主要有两种方式。
Polly 是 LangSmith 新推出的应用内功能,允许用户与一个智能体对话,从而分析 thread 和 trace 数据。用户可以用 Polly 来调试、分析并理解 Trace 中发生的情况,而不必手动扫描几十或几百个步骤。
例如,可以直接向 Polly 提问,让 AI 帮助定位问题。这种方式对深度智能体尤其有用,因为它们的追踪通常更长,失败模式可能分散在多个步骤之中。
除了单个 Trace,Polly 还能访问整个 thread 的信息。Thread 会跨越多个对话轮次,有时还会持续数小时甚至数天,人工很难完整掌握所有上下文。
在提示词演练场中优化系统提示
系统提示是深度智能体最重要的组成部分之一。Polly 被调校为一名出色的提示词工程师。用户只需用自然语言描述期望的行为,Polly 就会相应更新提示词。Polly 还可以帮助定义结构化输出,或在模型调用上模拟工具。
如果更习惯在 IDE 或代码智能体中工作,例如 DeepAgents、Claude Code 等,LangSmith 还提供了 CLI 工具 LangSmith Fetch,可以方便地连接 LangSmith 的 traces 或 threads。无论是调试智能体、分析对话流,还是从生产追踪数据构建数据集,这个 CLI 都能提供快速、灵活的访问方式。
热门跟贴