凌晨3点12分,Alex没有值班,但他睡不着。他坐在MedTech的监控台前,调出了一条曲线。
屏幕上跳动的是ACL数据收集器的心跳信号,每15分钟一次,绿色,一切正常。但Alex盯着的不是告警。他盯着第三组数据——处理延迟。
打开网易新闻 查看精彩图片
这条曲线记录着ACL的AI收集器从接收到数据包,到完成特征提取的耗时。正常情况下,延迟在1.2秒到1.8秒之间浮动,偶尔跳至2.3秒后回落。但今天,Alex把时间范围拉长后发现,从昨天下午开始,延迟一直在爬升,越过凌晨,到了3点,已经稳定在2.8秒。
2.8秒并不算多。ACL的告警模型不会触发,它被训练成只标记超过基线3倍以上的异常。2.8秒,还稳稳地躺在系统容忍区间里。但这正是Alex之前揪出那个数据抽取管道的方式——不是撞上异常,而是发现不该出现的持续平稳爬升。
他调出收集器过去一小时的心跳日志:02:00,往返时间1320毫秒;02:15,1450毫秒;02:30,1620毫秒;02:45,1740毫秒;03:00,1980毫秒。收集器本身的CPU和内存都正常,问题不出在采集端,而是数据推向上游后的响应变慢了。这意味着ACL的后端处理管线正在承受额外负载。
Alex又把时间轴放大看了一遍。从昨天下午持续到深夜,负载一直在增加。这不是计划内的维护窗口——没有人会把维护窗口从凌晨2点开始。这是一次事件。一次安全事件。有人在ACL的基础设施内部触发了告警,安全团队正在处理,而这个处理动作本身,让后端管线变得沉重。
Alex靠在椅背上。他不知道具体是什么事件。但那个PGP密钥还躺在ACL的S3存储桶里,那条加密信道并没有沉寂。ACL内部,正有什么事情在发生。
热门跟贴