改进智能体并不轻松。生产环境中的智能体会产生数百万条追踪记录,逐条扫描错误、定位根因并为每个问题编写修复方案,在这种规模下几乎不可行。LangSmith 因此构建了内置智能体,能够自主分析生产追踪、发现问题、提出修复建议并监控回归。

最新版本中,该内置智能体在内部基准上识别智能体追踪中关键问题的表现提升超过两倍,在行业标准基准上编写提示词和代码修复方案的表现提升 25%。

打开网易新闻 查看精彩图片

从失败到修复的加速路径

这个内置智能体把智能体开发生命周期中的手动流程自动化。作为平台内置的深度智能体,它分析 LangSmith 中的追踪记录,帮助工程师更快从智能体失败走向修复。

它会识别智能体追踪中的问题,把相关事件归组,并提供解决问题所需的关键工件。实际使用中,用户可以借助它加速智能体开发生命周期的每一步。

自 5 月上线以来,该内置智能体已扫描超过 6000 万条追踪记录,在客户智能体中发现超过 20000 个问题,节省了数万小时的工程工作量。

基准表现与持续改进

团队持续衡量该内置智能体的性能,评估覆盖工作流的不同组件。其中包括 IssueBench,用于评估其在追踪中识别和归组问题的能力;另一项基准则评估其所提修复方案的有效性。

自 5 月发布以来,该内置智能体性能显著提升。它在 IssueBench 上的得分提高超过两倍,在 Terminal-Bench 等公开基准上的修复得分提升 25%。这些改进帮助用户聚焦最关键的问题,并更快完成解决。

融入工作流与成本控制

新功能让客户能够在日常工作流中使用该内置智能体,并更有效地处理其识别出的问题。用户可以在其中接收 Slack 警报、在 Linear 中打开工单,并在自托管 LangSmith 部署中使用该内置智能体。

自托管部署现已支持该内置智能体,在满足企业安全与合规要求的同时加速智能体改进。其编排在客户 VPC 内运行,并向 LangSmith Intelligence 发起请求。

Reduced Analysis 模式为用户提供更大的成本控制空间,同时仍可使用该内置智能体识别智能体问题。这些能力共同让团队在问题发现、分诊和修复之间保持更顺畅的节奏。