AI在事故响应里到底能干什么?

Anthropic可靠性工程师Alex Palcuie分享了一线实操经验。他给出的判断很直接:在观察日志和追踪调用链这件事上,大模型的表现已经接近“超人”。

打开网易新闻 查看精彩图片

大量原始日志、分布式链路里的异常片段,人眼要翻很久,模型能快速扫完并标出可疑点。这部分工作重复、量大,正好是当前语言模型擅长的模式识别。

一到根因分析就露怯

但Palcuie也点出关键短板:模型在根因分析阶段仍然分不清相关性和因果性。日志里同时出现的两个异常,模型可能把它们当成因果关系,实际上只是碰巧一起发生。

这意味着AI可以帮你缩小排查范围,却不能替你下最终结论。把“可能相关”当成“就是它导致的”,在事故处理里会把人带偏。

怎么把AI接进值班流程

Palcuie的建议是让AI先进到on-call工作流里做辅助,而不是替代。具体来说:

  • 让模型先汇总日志和追踪信息,给出初步观察
  • 人类工程师负责验证因果、做决策
  • 保留人的专业判断,不让模型结论直接触发操作

核心原则是:AI负责看得快,人负责看得准。工程负责人需要设计好这个边界,否则团队的专业能力会被慢慢稀释。