数字信任势在必行:多云架构的核心价值
当2025年10月发生两次重大云故障时,我看到有人问了这样一个问题:“我们是否需要考虑多云部署,以确保我们几乎从不宕机?”没有人喜欢宕机。然而,真正的问题是,宕机究竟会给企业带来多大损失?
01可用性与数字信任
企业情况千差万别。有些组织在任何关键事务上都不依赖云计算。另一些组织确实依赖某些云服务,但云服务提供商(CSP)发生中断,即便是几个小时,也不太可能对这些组织的可用性、数字信任或利润产生重大影响。在这些情况下,部署多云架构可能没有强有力的业务理由。然而,一些组织已经建立了其声誉,即无论某个特定地理区域甚至某个云服务提供商(CSP)发生什么情况,其服务始终可用。对于这些组织而言,停机会对客户对其的信任产生负面影响。因此,除了因未能达到关于性能和可用性的合同义务而造成的短期经济损失外,还可能因现有合作关系终止以及潜在的新合作关系无法建立而导致长期损失。
02多区域架构
在考虑多云之前,让我们先退一步,看看在同一个云服务提供商(CSP)内的多区域架构。在设计高可用性架构时,每个能够提供此选项的CSP都会建议部署到多个区域,前提是客户认为成本值得。毕竟,如果某个区域发生突发事件,其他区域同时受到影响的可能性要低得多,特别是如果该区域被认为足够远,不会受到地理事件(如极端天气)的影响。主要的云服务提供商已经明确表示,如果一个组织打算部署到多个区域,那么成本会更高,而且业务和技术团队应就这一方案达成共识。亚马逊关于多区域的文档首先基于工作负载关键性、恢复点目标(RPO)和恢复时间目标(RTO)的预期,对相对成本进行了比较。该文档中包含的指导表明,大多数企业工作负载可能不需要多区域架构:“对于具有极端可用性需求(例如 99.99% 或更高可用性)或只有通过切换到另一个区域才能满足的严格业务连续性要求的关键任务工作负载,多区域方式可能是适用的。”换句话说,亚马逊建议,如果你确实需要,应该规划多区域覆盖——但要预期相应的成本。如果一个组织的服务每停机一分钟就会造成巨额损失,那么多区域部署的成本可能是值得的。但这并不是云服务提供商能够为客户决定的事情。它应该是基于风险的经过计算的商业决策。在数字信任方面,组织可能损失的不仅仅是金钱。我已经提到了声誉以及对新老业务的影响。在考虑成本时,所有因素都需要纳入,包括但不限于交易未处理、商品未售出等的有形损失。声誉影响可能难以准确估算,但同样是一项重要的成本考量。
03当其他人也宕机时
说到声誉受损,一家组织在遭遇服务中断时,能否避免其数字可信度受到负面影响?如果显然是其他方(例如云服务提供商或其他单一实体)的责任,那么答案是肯定的。例如,2025年10月亚马逊网络服务(AWS)的中断持续约15小时,最新估算显示此次事件造成了5.81亿美元的损失。据CyberCube统计,受影响的大型组织超过2,000家,总计约70,000家组织。鉴于受影响的组织数量如此之多,其中包括Snapchat等家喻户晓的品牌,有人可能会认为这对单个品牌的影响并不大;大多数人逐渐意识到这是AWS的问题,而非受影响的特定组织的过错。2024年由CrowdStrike引发的停机事件亦是如此。由于有关达美航空等受影响客户的新闻——以及其问题报告中的原因——CrowdStrike的声誉遭受了最严重的打击。总体而言,其股价下跌了近25%。
04中央控制平面问题
回顾十月份的两次故障,AWS的故障主要源于域名系统(DNS)问题,该问题导致了Dynamo DB的失败,进而引发连锁故障。随后Azure因配置更改而发生Front Door故障。与AWS类似,这也引发了其他故障的连锁反应。这些核心问题导致了跨区域的服务中断。在这两种情况下的问题都被称为中央控制平面问题。以AWS为例,DNS问题出现在US-EAST-1区域。理论上,问题应该只会局限于该区域。然而,该区域是“除联邦政府和欧洲主权云之外,所有AWS位置的共同[中央]控制中心。” AWS的大部分服务依赖于运行在US-EAST-1的服务。如果US-EAST-1的中断严重到那些关键服务开始失败,就可能产生全球影响,正如我们所见。微软Azure的Front Door引起了同样的问题。许多核心服务依赖于Front Door。当它宕机时,这些服务也随之宕机。因此,多区域部署也无法挽救组织免于停机。那么,一个组织如何避免这样的全球性中断呢?典型的答案是使用多个云服务提供商(CSP)。以Netflix为例,它通过在互联网服务提供商(ISP)站点部署内容分发服务器,在单一的CSP——AWS内为其流媒体服务建立了弹性。这也减少了流量,因此降低了成本,并最终降低了客户的延迟。然而,并不是每个人都能像Netflix一样。
05多云架构以提高弹性
如果一个组织即使在整个云服务提供商(CSP)发生故障时也必须保持运行,那么在多云架构中部署关键服务是合理的。再次强调,这不是一个技术决策,而是商业决策。另一种看问题的方式就像我们通常在网络安全领域所做的那样:如果缓解安全风险的解决方案的成本高于所保护资产的价值,那么实施该解决方案就是一个糟糕的商业决策。对于单一CSP中的多区域部署,以及跨两个或多个CSP的部署,也应做同样类型的考虑。考虑多云的理由不仅仅是为了弹性。它也可能归结为节省一些成本的可能性。但等等,多云和多区域一样,不应该是更昂贵的吗?
06多云架构的成本节约
考虑多云架构以节约成本,不同于希望通过它来避免中断,就像在弹性/可用性场景中所做的那样。如果有人在谈论多云为了节约成本,那是因为他们在“寻找最优惠的价格”。让我用一个类比来说明。任何使用在线服务的组织,尤其是直接通过云服务提供商(CSP)使用的组织,都应考虑多云战略。现在有博客,也有移动应用,允许购物者通过比较关键日用品的价格来确定哪些杂货店提供最佳优惠,即使这些商品本身并没有打折。如果我发现商店A通常在水果和蔬菜上价格最优,而商店B在食品储藏物品上价格最低,那么我可以通过在每个商店购买价格最优的商品来节省开支。通过四处比价购物,我每次买杂货都能花费更少。各种云服务提供商提供的服务也是同样的道理。例如,虽然Netflix在其核心基础设施上依赖AWS,但它在其他服务上使用谷歌云。这种类型的策略并不直接涉及数字信任,但它肯定可以帮助组织提高声誉。毕竟,如果一个组织以更低的价格提供与竞争对手相同或更好的服务,那么更多人会信任它。虽然从可用性/弹性角度来看,多云策略可能没有意义,但它确实是在数字信任生态系统中保持竞争力的严重策略。
07业务连续性
这两次重大中断事件让许多组织重新认识到业务连续性计划的重要性。即使我们拥有能够开发并部署的最佳技术解决方案,也必须为可能发生的网络中断做好准备。本地施工事件,例如挖掘机切断光纤,可能会导致组织的局部中断。组织应如何应对?业务连续性计划应考虑全面中断,并详细描述组织需要采取的步骤。可能简单到让员工当天回家,通过其ISP使用虚拟专用网络(VPN)连接工作。也可能复杂到手动运行关键功能。业务连续性计划必须存在,并且必须经过测试。毕竟,假设网络可靠是分布式计算的经典误区。如果有人期望因为有弹性架构就永远不会发生中断,那么他就犯了这一谬误。
08我的组织是否需要考虑多云?
任何使用在线服务的组织,尤其是直接通过云服务提供商(CSP)使用的组织,都应该考虑多云策略。然而,大多数组织并不需要多云方法可能带来的弹性。为了弹性而采用多区域策略成本很高。为了同样的目的采用多云策略可能会花费更多。相反,多云策略在降低运营成本方面是有意义的。在尝试以最佳价格提供优质服务时,针对特定类型的服务货比三家以获取最佳价格是有意义的。除了弹性之外,还有几个原因表明多云是最佳方案;之前已经提到过。如果这些原因适用,那么固守单一云服务商并非明智之举。最终,围绕多云策略做出的适当决定可能会对组织在当今数字信任生态系统中的声誉和信任产生直接影响(弹性和可用性)和间接影响(合规性、成本和客户需求)。
关于作者K. BRIAN KELLEY | CISA, CDPSE, CSPO, MCSE, SECURITY+是一名作家和专栏作家,主要关注Microsoft SQL Server 和Windows安全。他目前担任数据架构师以及独立的基础设施/安全架构师,专注于Active Directory、SQL Server和Windows Server。他曾担任过诸多职位,包括高级数据库管理员、数据仓库架构师、网页开发人员、事件响应团队负责人和项目经理。Kelley曾在24 Hours of PASS、IT/Dev Connections、SQLConnections、TechnoSecurity 和法证调查大会、IT GRC论坛、SyntaxCon,以及各种SQL Saturday、Code Camps和用户组上发表演讲。
.png)







