OpenSearch 项目团队宣布,将于 9 月 10 日举办一场面向站点可靠性工程师(SRE)和平台工程师的技术深度研讨会,重点介绍两项新能力:用于告警的 Piped Processing Language(PPL)和统一的 Alert Manager。这场直播将针对大规模可观测性场景中“告警最先出问题”的痛点展开。
OpenSearch 是 Linux 基金会旗下的顶级开源项目,由亚马逊云服务(AWS)等主要厂商支持。其可观测性栈将 AI 代理追踪、APM、服务地图、日志、指标和仪表盘统一在一个基于 OpenTelemetry 原生的开源平台中,内置了基于机器学习的异常检测功能。
告警工具跟不上数据增长
SRE 们并不缺遥测数据,问题在于处理这些数据的工具没能跟上节奏。随着 AI 代理为团队已经监控的信号增加了一个高容量的新数据源,这一差距正在扩大。Linux 基金会报告称,77% 的组织已将 OpenSearch 视为其 AI 基础设施的核心或支持组件,代理追踪就是原因之一。
为简单阈值设计的查询语言在处理多信号关联时显得吃力,告警规则在互不关联的工具间蔓延,值班工程师花在排查误报上的时间比调查真实事件还多。这正是 OpenSearch 团队推出 PPL 和统一 Alert Manager 的背景。
PPL:把 Unix 管道思维带入可观测性查询
PPL 将熟悉的 Unix 管道模型引入可观测性查询,让工程师能够用可读的语法在日志、指标和追踪数据之间进行过滤、转换和关联。通过像在终端中那样链式组合步骤,团队可以构建多步骤告警条件,识别细微的故障模式——例如,AI 代理工具调用的延迟飙升,只有在日志错误率同时升高时才变得需要处理。
由于 PPL 技能可以直接在搜索、分析和告警工作负载之间迁移,以前过于复杂而难以维护的告警条件,现在变得易于构建和传递给队友。
统一告警路由与 Apache 2.0 许可
与 PPL 一同推出的 Alert Manager,为团队提供了一个集中式界面来管理告警规则、路由、抑制和升级,确保纸面上的策略与团队实际响应事件的方式一致。本次网络研讨会涵盖的所有内容均以 Apache 2.0 许可证发布,无任何功能门槛限制。
直播将于 2026 年 9 月 10 日(周四)东部时间中午 12 点 / 太平洋时间上午 9 点举行。活动内容包括针对真实可观测性工作负载的现场演示,以及开放问答环节。AWS 团队将现场解答与会者的告警相关问题。
热门跟贴