AI在事故响应里到底能干什么?
Anthropic可靠性工程师Alex Palcuie分享了一线实操经验。他给出的判断很直接:在观察日志和追踪调用链这件事上,大模型的表现已经接近“超人”。
打开网易新闻 查看精彩图片
大量原始日志、分布式链路里的异常片段,人眼要翻很久,模型能快速扫完并标出可疑点。这部分工作重复、量大,正好是当前语言模型擅长的模式识别。
一到根因分析就露怯
但Palcuie也点出关键短板:模型在根因分析阶段仍然分不清相关性和因果性。日志里同时出现的两个异常,模型可能把它们当成因果关系,实际上只是碰巧一起发生。
这意味着AI可以帮你缩小排查范围,却不能替你下最终结论。把“可能相关”当成“就是它导致的”,在事故处理里会把人带偏。
怎么把AI接进值班流程
Palcuie的建议是让AI先进到on-call工作流里做辅助,而不是替代。具体来说:
核心原则是:AI负责看得快,人负责看得准。工程负责人需要设计好这个边界,否则团队的专业能力会被慢慢稀释。
热门跟贴