如果有人炸掉一个没有标记的AWS数据中心,客户会察觉吗?亚马逊云科技一位高管在2025年的一档电视采访中给出的回答是:"你们不会察觉的。我的意思是,我们可能会有点不高兴,但你们不会察觉的!"
这段视频在Hacker News上被重新翻了出来。背景是亚马逊云科技本周发布的一则状况更新:公司已告知客户,无法恢复仅存储在中东部分区域内的数据。
两个区域,两种受损程度
这次更新涉及中东(阿联酋)me-central-1和中东(巴林)me-south-1两个区域。亚马逊云科技在说明中表示,巴林地区的受损程度超出了其区域性多可用区服务的设计承受能力。
针对阿联酋区域,公司的表述是:经过全面评估,确定无法恢复对仅托管在 mec1-az2 可用区中的资源和数据的访问,同时继续努力恢复区域资源,以及托管在其他受影响可用区(mec1-az1 和 mec1-az3)中的可用区资源。
对巴林的评估则覆盖了整个区域。亚马逊云科技称,基础设施遭受的破坏波及多个可用区,超出了区域性多可用区服务的设计承受能力,因此确定无法恢复对仅托管于该区域的资源和数据的访问。
InfoQ 3月份曾报道,无人机袭击导致分布于这两个区域的三个亚马逊云科技数据中心受损,其中阿联酋的三个可用区中有两个受到严重影响,巴林的一个基础设施也遭到袭击。当时亚马逊云科技建议客户将关键数据复制到其他区域,不久后又建议将工作负载完全迁出中东地区。
公司表示正在更换受影响的基础设施,已通知相关主管部门,将在未来数月内更新服务恢复进展,关于巴林地区的更多细节将于2027年初公布。巴林区域于2019年开通,阿联酋区域于2022年开通。
争论的焦点不是袭击,是理解
Hacker News上的讨论,更多集中在客户对所购买服务的理解上,而不是袭击事件本身。
评论者 krick 描述了这种表态给客户带来的处境:这类说法相当常见,听起来合情合理,理应属实,所以尽管并不十分了解亚马逊云科技冗余规划的具体细节,但过去一直信任他们;当他们断言"没问题",结果一周后却发现并非如此时,这真的令人担忧。
评论者 houssc 补充了缺失的限定条件:这始终是"在你正确使用该服务"的前提下,而正确使用可不一定意味着免费,这意味着要充分利用多个地理区域,在技术栈中构建冗余机制。
评论者 jacquesm 则指出他最常看到的误解——团队认为只要使用了亚马逊云科技的云服务就是对的:他们没有意识到,AWS只是一个工具箱,而不是"针对你可能面临的所有灾难而预先准备好的冗余解决方案"。
相关文档印证了这一解读。S3 Standard及其相关存储类服务会在一个区域内的至少三个可用区内冗余地存储对象,亚马逊云科技声明其年数据持久性达99.999999999%。这两点均属于区域级特性。评论者援引的亚马逊云科技灾难恢复指南显示,该公司长期以来一直建议客户将备份复制到另一个区域,其中包括这样一句说明:所有灾难恢复策略都要求先在区域内备份数据源,然后将其复制到恢复区域。
谁应该知道这件事
讨论的分歧点在于"谁应该知道"。
评论者 albert_e 认为,该知识并非隐蔽信息,因为即使是最基础的AWS认证课程,也会讲授"共同责任模型"以及客户的义务从何处开始。
也有人认为,这种负面观感应归咎于供应商。评论者 mhitza 指出,云服务提供商是通过营销和会议渠道向企业高管们灌输这一理念的,就像过去两年间人工智能的相关论述如何传入了企业高管们的耳朵中。
评论者 lelanthran 则将这一观点转化为一个现实问题:CEO会相信谁?是亚马逊、微软以及整个IT基础设施部门,还是那个与他们持不同意见的孤军奋战的SRE?
评论者 dijit 给出了一个结构性的解释:分布式存储是在性能与正确性之间进行权衡,而外包则意味着由他人来进行这种权衡,而且权衡的侧重点会倾向于客户能察觉到的方面——你不会注意到还有一台位于异地的第三提交服务器(除非该站点遭到轰炸),但你会注意到写入速度变慢了。
数据驻留:无法复制的困局
最尖锐的讨论集中在那些无法在其他地方进行数据复制的客户身上。亚马逊云科技表示,无法恢复的数据完全托管在受影响的可用区和区域内,有评论者将这一表述与要求信息必须保留在国家边界内的数据驻留义务联系起来。将加密备份发送至国外显然无法解决这个问题,因为解密密钥也需要位于管辖范围之外,才能在区域性数据丢失后发挥作用。
这种矛盾在3月份就已经显露无遗。T-Systems International的一位高级云架构师当时警告称,虽然在危机期间迁移工作负载可能恢复服务,但会将敏感数据推向国境之外,并且数据驻留是一项法律要求,而非最佳实践。
《企业集成模式》一书的合著者 Gregor Hohpe 在今年3月指出,这种风险是地理性的,而非合同性的:风险是区域性的,与特定服务提供商无关,那些攻击了 ME-CENTRAL 的人,同样可以轻松地攻击 Azure 或任何其他数据中心。
六个月后,这种论述已经产生了具体的效果。多可用区架构将工作负载分布在彼此相距约100公里的多个设施中,这可以防范亚马逊云科技列出的各种故障模式,包括停电、雷击、龙卷风和地震。但它无法防范能在同一晚上同时袭击其中多个设施的攻击者。
亚马逊云科技的表述是,无法恢复的数据完全托管在受影响的区域和可用区内。对任何团队而言,实际的检验标准在于:目前是否有任何数据仅存于一个区域且在其他地方没有副本,以及监管或合同义务是否允许副本离开该管辖区。如果不符合上述条件,则剩余的风险并非架构漏洞,而是对架构的限制,应列入风险登记册而非运行手册。
亚马逊云科技表示,他们仍然致力于为阿联酋和巴林的客户提供支持,需要协助的客户可联系其支持团队。
热门跟贴