高可用性 (HA) 通常被誉为保障正常运行时间的终极目标。集群、冗余服务器和多区域部署承诺提供“四个九”的可靠性。然而,历史表明,即使是最精心设计的高可用性系统也可能发生灾难性故障。区域性云中断、勒索软件攻击和人为错误都可能导致整个基础设施瘫痪,而这些仅靠高可用性无法避免。这就是为什么…… 灾难恢复(DR) 必须将其视为一门独立的学科。 RELIANOID我们不仅提供稳健的高可用性架构,而且还提供经过测试的架构。 灾难恢复策略 为组织提供真正的安全保障。
高可用性与灾难恢复
虽然人道主义援助和灾害救援相辅相成,但它们的目标和方法却截然不同。理解二者的区别对于构建真正的韧性至关重要。
| 属性 | 高可用性 | 灾难恢复 |
| 适用范围 | 局部故障 | 区域性/灾难性故障 |
| 例子 | 节点崩溃,可用区中断 | 数据损坏、勒索软件、区域性故障 |
| 目的 | 保持正常运行时间 | 灾后恢复服务和数据 |
| 工具 | 负载均衡器、集群、自动扩缩容 | 备份、复制、多区域部署 |
| 专注 | 预防 | 复修 |
例如:跨多个可用区的 Kubernetes 集群可以在同一区域内提供高可用性 (HA)。但如果整个区域发生故障或勒索软件攻击导致数据损坏,HA 就无能为力了。灾难恢复 (DR) 计划(包括备份、异地复制和自动故障转移)可以确保在 HA 失效时实现恢复。
真实世界的教训:当HA(高可用性)不足以应对时
几起备受瞩目的故障事件表明,灾难恢复必须成为每个组织基因的一部分:
- GitLab(2017): 一次意外的数据库删除操作波及到冗余系统,导致公司不得不紧急使用过时的备份。教训:冗余并不等于恢复。
- 代码空间(2014): 云账户被盗导致服务器和备份数据永久删除。由于缺乏云端以外的恢复方案,该公司被迫关闭。教训:灾难恢复必须隔离且独立。
- 马士基(2017): NotPetya恶意软件加密了全球各地的系统。幸亏有一个离线备份域控制器才挽救了这家公司。教训:离线和异地备份至关重要。
- 脸书(2021): BGP配置错误导致包括内部工具在内的全球服务瘫痪。教训:灾难恢复不仅关乎数据,还关乎恢复工具的可访问性。
关键指标:RTO 和 RPO
灾难恢复的衡量标准有两个关键指标:
- 恢复时间目标 (RTO): 可容忍的最大停机时间。服务必须以多快的速度恢复?
- 恢复点目标 (RPO): 最大可接受数据丢失量(以时间衡量)。您能承受丢失多少近期数据?
例如:如果您的恢复时间目标 (RTO) 为 1 小时,恢复点目标 (RPO) 为 15 分钟,那么中午 12:00 发生的故障意味着服务必须在下午 1:00 前恢复,数据必须至少恢复到上午 11:45。更严格的 RTO 和 RPO 目标需要对灾难恢复 (DR) 基础设施进行更高的投资,但通常可以节省更多的停机成本。
灾难恢复架构
企业可以根据灾难恢复的关键性和预算,从多种灾难恢复策略中进行选择:
- 备份与恢复(冷灾难恢复): 成本最低,恢复时间最短。适用于非关键工作负载。
- 指示灯: 在另一个区域复制的最小备用环境,在故障转移期间激活。
- 热备: 部分缩减的灾难恢复环境始终运行,恢复速度比指示灯更快。
- 热备用(主动-被动): 完全镜像的环境已准备就绪,可在系统故障期间接管。
- 主动-主动(多站点): 多个站点同时运行,提供流量服务。弹性最高,成本也最高。
创新中心 RELIANOID 提供高可用性和灾难恢复
At RELIANOID我们将两者整合起来 高可用性 和 灾难恢复 将它们纳入我们的解决方案中,因为二者缺一不可:
- 高可用性: 我们的 应用交付控制器 (ADC) 提供集群、负载均衡和自动故障转移功能,以在局部故障期间保持正常运行时间。
- 灾难恢复: 我们设计 多区域异地复制策略 具备自动故障转移机制。这确保即使在发生灾难性故障时,业务也能持续进行。
- 备份和测试: 我们维持 安全、不可篡改的备份 并定期进行恢复演练,以确保灾难恢复计划在需要时能够真正发挥作用。
- RTO/RPO 对齐: 我们的解决方案根据客户的服务水平协议 (SLA) 量身定制,在成本、复杂性和关键性之间取得平衡,以满足业务定义的恢复时间目标 (RTO) 和恢复点目标 (RPO)。
通过同时提供HA和DR, RELIANOID 不仅能确保在正常压力下持续运营,还能确保在人为或环境等特殊灾害下恢复运营。
我们遵循的最佳实践
- 隔离不同环境以防止单点故障。
- 不可篡改的、版本化的备份,可抵御勒索软件攻击和意外删除。
- 使用基础设施即代码工具自动配置灾难恢复基础设施。
- 定期进行灾难恢复测试和混沌模拟。
- 详细的操作手册和文档,用于快速事件响应。
结语
高可用性固然重要,但仅靠它还不够。随着基础设施变得越来越分散,威胁也越来越难以预测, 灾难恢复已不再是可选项。高可用性 (HA) 可在轻微故障期间保持系统稳定;灾难恢复 (DR) 可确保系统在灾难性故障期间生存。二者共同构成真正韧性的基础。
At RELIANOID我们提供架构,将成熟的高可用性机制与经过严格测试的灾难恢复策略相结合。从负载均衡集群到多区域故障转移和不可变备份,我们的方法将可能发生的灾难性停机转化为可控的中断。预防的成本永远低于故障的成本——我们的客户也知道我们能帮助他们。 做好两方面的准备。
RELIANOID超越正常运行时间,迈向韧性。