一个正在被越来越多可观测工程师接纳的判断是:大语言模型的推理能力,在AI辅助根因分析这个场景里,已经不再是第一位的瓶颈。真正的硬仗,移到了更上游——到底让哪些数据流进模型,以及怎么组织这些数据。这件事正悄悄改变一些团队往事故响应里塞AI的方式。
对于那些把LLM塞进事故响应流程的团队,当前最实在的建议是:花力气做上下文准备,很可能比再换一个更大的模型更有回报。与其不断升级模型参数规模来弥补推理盲区,不如在数据供给管道上多下功夫。
打开网易新闻 查看精彩图片
眼下AI根因分析的玩法大致分成两个流派。一类是智能体式设计,把工具交给模型,让它在推理过程中自己决定去拉哪些遥测信号,边走边查。另一类是确定性设计,先由上游系统把信号关联好,把一套整理过的上下文打包,再一次性喂给模型。前者给模型最大的探索自由度,但容易在多轮交互中发散;后者追求可控,但对前置的上下文工程要求高得多。
Coroot的实践路径,是行业朝向第二种方案倾斜的一个缩影。Dynatrace的Davis AI同样走的是确定性、基于拓扑的因果分析路子,它在实时依赖图谱里穿行,直接定位根因,而不是把LLM扔进一个没边界的智能体循环中自由发挥。这两种流派各有各的崩塌方式,这也使得把它们放在一起评估变得异常棘手。而在这种分裂里,越来越多团队意识到:别光盯着模型会不会推理,先看它能不能拿到对的数据。
热门跟贴