在 ClusterMAX 2.0 的评测里,Lambda 的可靠性是被点名批评的一项。到了这一轮测试,这成了他们重点补的功课。
结果摆在数据里:测试中模拟的3 个错误,全部被自动修复。其中两个合成 XID 在不到 15 分钟内完成自动处置,配套的仪表盘可以实时监控节点健康状态。
打开网易新闻 查看精彩图片
两个合成 XID:15 分钟内自愈
Lambda 的被动健康检查覆盖了相关条件,这是它能自动修复的前提。两个合成 XID 的处置时间都压在 15 分钟以内,节点健康状态有连接的仪表盘可供查看。
对跑训练任务的人来说,这个时间窗口的意义在于:故障被发现、被处理、被确认,整个过程不需要人守在终端前。
一个真实 XID 79:两小时后归队
测试里有一个场景没能走通自动修复这条路。团队通过执行 PCIe 二级总线重置,触发了一个真实的 XID 79。
这个节点随后进入 NotReady 状态,但没有产生 GpuXid,没有被 cordon,在 Kubernetes 层也没有任何监控可见性。最终它在2 小时后重新加入了集群。
同一轮测试中,Kubernetes 层的节点重启测试则顺利完成,没有出现异常。
把这两组结果放在一起看,Lambda 的自动修复能力在合成故障上表现干净,在真实硬件级故障上则暴露出监控链路的盲区——节点掉出去了,但 Kubernetes 层看不到发生了什么。
被批评之后,补的是哪一课
ClusterMAX 2.0 的批评指向可靠性,这一轮测试里 Lambda 把被动健康检查和自动修复作为重点。三个模拟错误全部自动修复,是这一轮拿到的成绩。
评测方的评价是:Lambda 团队在 ClusterMAX Sliver 上做得不错。
热门跟贴