尽管许多AIOps平台承诺提供自动化和智能,但大多数仍依赖条件逻辑、脚本化工作流、仪表板或副驾驶式摘要。这些方法可以改善可见性,但往往无法实现真正的自主性。
原因很简单:它们缺乏企业记忆、跨领域推理和受治理的执行。
与此同时,人们对大型语言模型(LLM)驱动的智能体越来越兴奋。虽然强大,但仅靠LLM并不足以实现自主运营。
真正的智能体系统需要将经典机器学习与生成式AI相结合,共同提供预测性、因果性的智能和可靠的结果。
智能体AI代表了IT运营的下一次演进。但实现这一目标需要的不仅仅是采用新工具,还需要构建正确的基础。以下是组织迈向安全、可扩展和自主运营的五个关键步骤。
1. 从统一的数据基础开始
现代IT环境复杂且分散。数据分布在监控工具、日志、指标、IT服务管理系统等之中。每个系统只提供部分视图,但没有任何一个能提供全貌。
要让AI有效运作,它需要访问一个统一且持续优化的数据层。这意味着要从整个环境摄取数据,对其进行规范化、用上下文丰富数据,并使其能够实时使用。
没有这个基础,AI系统只能孤立运行,导致洞察不完整、决策不一致。有了它,组织就能创建统一、可靠的运营视图,从而实现更深入的理解和更快速的行动。
2. 借助混合AI超越大语言模型
生成式AI已经改变了团队与数据交互的方式,使总结事件、生成报告和辅助操作员变得更加容易。但总结不等于推理。
要实现真正的自主性,组织需要一种混合方法,将用于检测模式和预测问题的经典机器学习、用于理解问题发生原因的因果分析,以及用于将洞察转化为用户友好型输出和建议的生成式AI结合起来。
这种组合使系统能够超越描述正在发生的事情,进而预测将要发生的事情——以及该采取什么措施。如果没有预测和因果智能,自动化仍将是被动的。有了它,运营就可以转向预防。
3. 构建随时间不断学习的系统
代理式AI的一个决定性特征是持续改进的能力。这需要的不仅仅是静态模型:它还需要记忆。企业记忆使系统能够保留有关过去事件、解决方案和模式的知识。
随着时间的推移,这使AI能够更快地识别重复出现的问题,更准确地应用经过验证的解决方案,并适应环境的变化。
没有记忆,系统每遇到一个新事件都从零开始。有了记忆,它们就能积累日益增长的运营智能,每次互动都更高效。
4. 尽早嵌入治理与防护措施
AI系统担的责任越多,风险也就越大。如果管控不当,自主行为可能会给系统和团队带来风险。所以从一开始,就要把治理嵌入智能体系统中。
这包括:规定AI能做什么、在什么情况下做;对高风险场景设置审批流程;确保数据访问安全、权限适当;还要让决策过程透明。
强有力的防护措施并不会限制AI,反而能让AI发挥更大作用。它们提供了必要的框架,让组织能信任自动化决策,并安全地扩大使用范围。
5. 逐步迈向自主运行
让IT运营实现“自动驾驶”不是一夜之间的事。最成功的组织都是分阶段推进的。一开始通常是让AI提供洞察、摘要和建议,辅助人类的工作流程。
随着信任度提高,AI工具可以在监督下开始执行任务。随着时间的推移,系统可以在划定的范围内更独立地运行。
一个可行的推进过程是这样的:
- 辅助运维:AI 提供全局洞察和建议
- 引导式自动化:AI 提出操作建议,经人工批准后执行
- 受控自主:AI 在预设的安全边界/规则范围内执行
- 自主运维:AI 持续监控、预测并采取行动
采用这种方式,团队可以在扩大自主权之前,先建立信任、验证成效、完善治理。
为什么很多 AIOps 项目收效甚微
尽管投入巨大,很多 AIOps 项目还是没能做出有实际意义的成果。常见的问题不是缺工具,而是基础没打好。
主要挑战包括:数据零散且不一致;过度依赖规则和静态关联;预测和解释结果的能力有限;缺乏持续学习和记忆;对自动化操作也缺乏有效的治理。
弥补这些差距,才能从渐进式改进走向真正的转型,这一点至关重要。
通往自主运维之路
Agentic AI 描绘了一个很有吸引力的前景:IT 系统能够在用户受到影响之前预测问题、查明原因并自动采取行动。但要实现这个愿景,不能只是紧跟最新的 AI 技术潮流。必须有一套严谨的方法来对待数据、智能和治理,同时规划出一条清晰的运维成熟度演进路径。
投资于这些基础能力的组织将能顺利从被动式运维转向预测性、智能化,乃至最终实现自主化的系统。
这样一来,组织不仅能提高效率,还能从根本上改变IT的运作方式,让团队不用整天救火,而是把更多精力放在推动创新和创造业务价值上。
热门跟贴