打开网易新闻 查看精彩图片

微软 Azure 发生大范围网络故障,ExpressRoute Gateway、VPN Gateway、Azure Firewall、Application Gateway 以及 Azure VMware Solution 等多项服务受到影响,故障波及全球 19 个 Azure 区域,持续约 5 小时 45 分钟。

打开网易新闻 查看精彩图片

微软调查显示,此次事故与此前对区域网关管理服务的一次变更及随后进行的基础设施操作系统维护有关。

两者叠加后触发超出预期的负载,相关服务未能按照预期完成扩容。

根据微软 Azure 状态页面,此次事故始于 9 月 30 日 20:30 UTC,至 10 月 1 日 02:15 UTC 完成缓解。

受影响客户可能遭遇网络连接性能下降或中断、Azure Portal 中网关无法加载,以及部分网络管理操作失败或延迟。

受影响服务包括 Azure ExpressRoute Gateway、Azure Firewall、Azure Application Gateway 和 Web Application Firewall(WAF)、Azure VPN Gateway,以及 Azure VMware Solution(AVS)。

其中,ExpressRoute Gateway 用于通过专用连接将企业本地网络接入 Azure 虚拟网络,VPN Gateway 用于在企业本地基础设施与 Azure 之间建立加密连接;Azure VMware Solution 则允许企业在 Azure 基础设施上运行 VMware 环境。此次事故因此影响了部分依赖 Azure 连接本地数据中心与云端资源的企业混合云环境。

微软状态信息列出的受影响区域包括 West US、West US 3、Mexico Central、North Europe、West Europe、France Central、UK West、UK South、Switzerland North、Germany North、Southeast Asia、East Asia、Australia East、South India、Japan West、Korea Central、South Africa North、UAE North 和 Jio India Central,共计 19 个区域。

不同服务在这些区域的实际影响范围并不完全相同。

事故发生后,微软首先调查 UK South 区域 Azure ExpressRoute Gateway 出现的连接问题。9 月 30 日 21:29 UTC,微软开始调查;22:27 UTC,微软确认问题已经影响多个 Azure 区域,并扩大调查范围。

23:05 UTC,微软发现事故发生时间与基础设施操作系统维护活动存在关联,因此暂停进一步的 OS 维护。

进一步调查发现,事故发生前,微软曾对 Regional Gateway Management Service(区域网关管理服务)实施变更。随后,一项原本与该变更无关的操作系统维护逐步进入多个 Azure 区域,此前的网关管理服务变更由此触发高于预期的负载。

正常情况下,网关管理服务会根据需求自动扩容,但此次负载增加的同时,其依赖服务承受的需求也随之上升,最终导致相关区域服务未能按照预期完成扩容,并造成多个 Azure 网络服务异常。

微软随后暂停相关操作系统维护,并回滚此前实施的 Regional Gateway Manager 变更。回滚后,网关管理服务的负载下降,受影响服务逐步恢复。

事故期间,不同服务受到的影响并不完全一致。

部分 VPN Gateway 并未完全失去连接,而是出现冗余能力下降。此外,一些负责网络管理操作的组件没有随其他服务自动恢复,导致部分区域继续出现管理操作失败,微软随后利用其他健康实例恢复相关组件。

到 10 月 1 日 01:36 UTC,大部分受影响区域已经恢复。

微软随后继续处理 France Central、North Europe、Southeast Asia、UK South 和 UK West 等剩余区域。02:15 UTC,微软确认事故完成缓解。

微软目前仍在调查相关服务为何未能按照设计正常扩容,以及需要增加哪些保护机制来防止类似问题再次发生。微软还将发布完整的 Post Incident Review(PIR,事故后审查报告),进一步披露事故原因及后续改进措施。

云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片