7月23日晚间,一次指向北美地区的网络配置变更,让许多依赖微软365的企业用户突然陷入“断联”状态。微软官方将此次事故记录为事件ID MO1437424,中断于美国东部时间当日上午10:44前后开始,持续超过三小时。
受影响的远不止一两个办公应用。根据微软服务健康公告,中断波及了OneDrive、SharePoint Online和Teams等日常协作工具,Copilot Chat与Copilot Studio等AI功能也无法访问。在自动化与数据分析方面,Power Automate、Power Apps、Fabric及Power BI均告瘫痪。此外,合规型服务Microsoft Purview和协同笔记应用Loop同样难逃此次风波。微软指出,凡是微软365流量经过北美地区的用户,都可能遭遇访问障碍、网页加载失败、文件取用异常、Teams协作中断及自动化工作流停摆等问题。
在中断发生约两个半小时后,微软于当晚9点52分初步锁定了潜在诱因——一次近期的网络配置变更。工程团队随即开始回滚该变更,同时不断尝试将流量疏导至备用网络路径。官方在社交平台X上的“Microsoft 365 Status”账号也同步通报了排查动态,并指引管理员前往后台查看详细事件记录。
对企业而言,这次事故直观展示了云服务底层网络架构的脆弱一面:即便各个应用程序和租户实例自身运转正常,一次有问题的网络更新也足以将用户拒之门外。微软称,在回滚之前已识别出替代路径,并验证了提高可用性的最佳步骤,随后扩大了对服务基础设施的流量重路由。内部遥测数据一度显示出“持续好转”的迹象。
最终确认于次日凌晨到来。7月24日上午12点06分,微软宣布网络配置回滚执行完毕,遥测反映各项服务已恢复。监控环境并未随之放松,团队后续联系了部分受影响用户,以辅助验证服务是否真正回归常态。至凌晨2点后,该事件的状态被正式标记为“服务已恢复”。
热门跟贴