跨区域容灾与切换编排参考架构
【摘要】 华为云存储容灾服务(SDRS)跨区域灾难恢复,Web应用可扩展工作负载保护,支持分钟级RTO
1. 用途和受众
1.1 预期用途
- 指导企业在华为云上为关键业务系统(ECS/CCE 工作负载、RDS/GaussDB 数据库、OBS 对象数据)设计和实施跨区域容灾,覆盖持续数据复制、容灾演练、故障切换与回切全生命周期。
- 借鉴业界主流的"块级持续复制 + 编排化恢复"容灾模式:在源端持续将数据以块级方式复制到目标区域的待命环境(staging),灾难宣告后编排化启动恢复实例,实现秒级 RPO、分钟级 RTO,并支持不影响生产的容灾演练与故障回切。
- 为售前、解决方案设计、实施和审查提供可重用的跨区域容灾架构模式。
- 作为容灾建设交付包、等级保护与行业监管容灾合规要求、实际部署的架构基础。
- 定义可靠性、性能、安全、成本和运营护栏。
1.2 目标受众
- SRE 与容灾应急团队:负责容灾方案设计、演练组织、切换与回切执行
- 交付架构师:负责跨区域容灾架构落地、数据同步配置与切换编排交付
- 云平台管理员:管理容灾资源、复制策略与切换编排流程配置
- 业务连续性管理者:评估 RTO/RPO 指标,制定容灾预案与应急响应流程
- 企业客户(金融/政企/制造等关键业务):评估跨区域容灾方案,保障核心业务连续性
- 合作伙伴与 MSP:参与容灾实施、演练支持与容灾运营托管
2. 参考架构概述
2.1 架构描述
基于华为云生产区域(Region A)与容灾区域(Region B),构建"生产区域 → 复制与备份通道 → 容灾区域 → 切换编排"四层跨区域容灾架构:生产区域以 ECS/CCE 承载工作负载,数据承载于 EVS 云硬盘、RDS/GaussDB 数据库与 OBS 对象存储;复制通道层以 SDRS 存储容灾服务提供同城跨 AZ 块级同步复制(RPO=0),并以 CBR 云备份跨区域复制、DRS 数据库跨区域实时同步(灾备实例)、OBS 跨区域复制、ECS 镜像跨区域复制将数据持续推送到容灾区域待命环境;CES 监控复制链路与 RPO 指标、SMN 告警闭环;灾难宣告时由 DNS 全局流量管理健康检查触发流量切换,FunctionGraph 编排化启动恢复实例并激活灾备数据库,业务在容灾区域恢复;生产区域恢复后反向同步并回切。全程支持不影响生产的定期容灾演练。
2.2 业务背景
| 项目 | 描述 |
|---|---|
| 业务问题 | 关键业务单区域部署,面临区域级故障(机房级灾难、大面积网络中断)时业务长时间不可用;传统容灾建设成本高、周期长,且演练往往影响生产 |
| 期望的结果 | 跨区域容灾能力:同城同步复制 RPO=0、跨区域复制 RPO 秒级,RTO 分钟级;支持不影响生产的定期演练;可切换、可回切、可复盘 |
| 主要用户 | 业务系统负责人、SRE / 容灾应急团队、安全与合规团队 |
| 关键制约因素 | 关键业务等级保护(三级及以上)与行业监管容灾要求;跨区域网络带宽与复制时延预算;容灾区域待命资源成本;数据驻留合规 |
| 成功指标 | 跨区域链路 RPO ≤ 秒级、RTO ≤ 分钟级;演练成功率 100% 且零生产影响;复制链路可用率 ≥ 99.9%;切换操作全程留痕 |
2.3 架构优点
- 多层复制防护:SDRS 同城跨 AZ 同步复制(RPO=0)叠加 CBR/DRS/OBS 跨区域复制,同步与异步结合,兼顾 RPO 目标与容灾成本。
- 秒级 RPO / 分钟级 RTO:块级持续复制与数据库实时同步将数据丢失窗口压缩到秒级;编排化启动恢复实例与激活灾备数据库,将恢复时间压缩到分钟级。
- 无影响容灾演练:SDRS 容灾演练与 CBR 备份恢复演练在容灾区域以隔离方式拉起恢复实例,验证业务可用性与数据完整性,对生产业务零影响,满足合规演练要求。
- 自动化切换编排:FunctionGraph 将恢复/回切动作编排为可复用的编排流程(启动恢复实例、激活灾备数据库、切换解析),减少人工操作失误。
- 全局流量调度:DNS 全局流量管理基于健康检查自动完成区域间流量切换,用户访问无感知。
- 成本可控:容灾区域采用待命模式(低规格待命资源 + 备份/副本存储),无需 1:1 建设完整镜像生产环境。
- 安全合规:IAM 最小权限与跨区域委托授权,复制传输加密,备份库与对象桶版本化防篡改,切换与演练操作可审计。
2.4 设计关注点
| 性能 | 安全 | 可扩展性 | 运维 | 可靠性 |
|---|---|---|---|---|
| 按数据变化率规划复制带宽(初始全量窗口与增量峰值分开评估);跨区域选择时延 ≤30ms 的区域;DRS 同步规格随源端数据库负载选型;OBS 跨区域复制带宽配额提前申请 | IAM 最小权限与跨区域委托授权替代长期凭证;复制与备份传输加密;容灾区域备份库与对象桶开启版本化与防误删;切换/回切操作双人复核并全量审计 | 保护组/复制对随业务规模扩展;容灾区域预留 ECS 规格、EVS 容量与数据库规格配额;流量增长时 DNS 全局流量管理与复制链路带宽可在线扩容 | CES 统一监控复制链路状态与 RPO/时延指标并联动 SMN 告警;FunctionGraph 编排脚本版本化管理;定期自动演练并输出复盘报告;回切窗口与数据一致性校验流程预先演练 | 关键数据同步 + 备份双通道冗余;每季度至少一次演练验证可恢复性;DNS 健康检查多重探测防止误切换;切换/回切保留自动化编排与手工预案双轨 |
2.5 典型架构

华为云跨区域容灾架构图
2.6 流程描述
- ① 保护组定义与初始全量同步:输入为保护对象清单(ECS/CCE 工作负载、EVS 云硬盘、RDS/GaussDB 实例、OBS 桶)与容灾策略;创建 SDRS 保护组与复制对(同城跨 AZ 保护)、创建 DRS 跨区域容灾任务与 CBR 备份存储库,并执行初始全量数据同步到容灾区域;输出为处于保护状态的容灾链路与完成初始化的容灾区域待命环境。
- ② 持续复制:输入为生产业务产生的增量数据与变更块;SDRS 执行块级同步复制(同城跨 AZ,RPO=0),DRS 将数据库变更跨区域实时同步至灾备实例,OBS 跨区域复制将对象持续写入容灾区域副本桶(ECS 镜像同步跨区域复制备用);输出为容灾区域数据与生产保持准实时一致。
- ③ CBR 跨区域备份留存:输入为备份策略(周期、保留时长);CBR 对云服务器与数据库执行周期性备份,并将备份跨区域复制到容灾区域存储库存放;输出为可按时间点恢复的跨区域备份集,满足长期留存与防勒索要求。
- ④ 监控复制状态与 RPO 度量:输入为各复制链路运行指标;CES 采集 SDRS/DRS/CBR/OBS 复制状态、复制时延与 RPO 指标,超阈值经 SMN 告警通知容灾运维团队;输出为复制链路健康度的持续可观测与告警闭环。
- ⑤ 定期容灾演练验证:输入为演练计划(季度/合规要求);通过 SDRS 容灾演练或 CBR 备份恢复演练,在容灾区域隔离拉起恢复实例(ECS/CCE)并验证业务可用性与数据完整性;输出为演练报告,全程不影响生产业务。
- ⑥ 故障切换:输入为区域级故障事件或人工切换指令;DNS 全局流量管理健康检查判定生产区域不可用后将流量切换至容灾区域入口,FunctionGraph 执行恢复编排——基于备份/副本拉起恢复实例、激活 DRS 灾备实例为主用、OBS 副本桶转为读写;输出为业务在容灾区域恢复运行(RTO 分钟级)。
- ⑦ 回切与复盘:输入为生产区域恢复完成确认;建立 DRS 反向(容灾→生产)同步回流增量数据,FunctionGraph 执行回切编排,DNS 流量切回生产区域并恢复复制方向与保护组;输出为业务回归生产区域、切换复盘报告与容灾策略优化建议。
2.7 云服务产品清单
| 分类 | 服务或产品 | 推荐配置 | 官网链接 |
|---|---|---|---|
| 生产区域工作负载 | ECS 弹性云服务器 | 生产应用服务器,多 AZ 部署,系统盘/数据盘挂 EVS | ECS |
| 生产区域工作负载 | CCE 云容器引擎 | 生产容器集群,节点池跨 AZ 分布 | CCE |
| 生产区域工作负载 | EVS 云硬盘 | 高 IO/超高 IO 型数据盘,加入 SDRS 复制对 | EVS |
| 生产区域工作负载 | RDS 关系型数据库 | 主备实例多 AZ 部署,目标区域创建跨区域灾备实例 | RDS |
| 生产区域工作负载 | GaussDB | 生产主实例多 AZ 部署,跨区域灾备实例实时同步 | GaussDB |
| 生产区域工作负载 | OBS 对象存储 | 生产主桶开启跨区域复制,版本化存储 | OBS |
| 复制与备份通道 | SDRS 存储容灾服务 | 保护组 + 复制对,同城跨 AZ 同步复制(RPO=0),支持容灾演练 | SDRS |
| 复制与备份通道 | CBR 云备份和恢复 | 备份存储库 + 跨区域复制,备份保留策略按合规要求设置 | CBR |
| 复制与备份通道 | DRS 数据复制服务 | 跨区域实时同步 + 灾备实例,支持故障切换与反向同步(回切) | DRS |
| 复制与备份通道 | OBS 跨区域复制 / ECS 镜像跨区域复制 | 主桶→容灾区域副本桶持续复制;系统镜像跨区域复制供恢复使用 | OBS |
| 容灾区域 | ECS / CCE 恢复环境 | 待命恢复资源(低规格预留),切换后按需扩容承载生产流量 | ECS |
| 容灾区域 | EVS 副本盘 / RDS 灾备实例 / OBS 副本桶 | 复制产生的待命数据层,演练与切换时直接启用 | EVS |
| 切换编排 | DNS 全局流量管理 | 健康检查 + 故障切换策略,生产/容灾双区域入口调度 | DNS |
| 切换编排 | FunctionGraph | 恢复/回切编排函数,事件触发执行,脚本版本化管理 | FunctionGraph |
| 公共服务 | CES 云监控 | 复制链路状态、RPO/时延指标监控看板与告警规则 | CES |
| 公共服务 | SMN 消息通知 | 告警订阅(短信/邮件/HTTP 回调),触达容灾应急团队 | SMN |
| 公共服务 | IAM 统一身份认证 | 跨区域资源最小权限、委托授权、MFA,切换操作留痕 | IAM |
3. 参考链接
- 产品文档:
- 实施指南:
- 源代码或 IaC:
- 操作手册:
- 安全性和合规性映射:
4. 使用限制
- 初始全量同步占用带宽与存储资源,须安排在业务低峰窗口并限速;超大数据量(数十 TB 级)应评估离线初始化方案。
- 跨区域复制为异步机制(SDRS 同步复制仅限同城跨 AZ),极端故障下可能丢失秒级未同步数据;要求严格 RPO=0 的业务应优先采用同城跨 AZ(SDRS)双活/主备部署。
- 故障切换后容灾区域需扩容承载全量生产流量,须预先预留 ECS 规格、EVS 容量与数据库规格配额,否则 RTO 将显著拉长。
- 回切需建立反向复制链路并执行数据一致性校验,期间双向变更需冲突处理,必须按预演过的回切预案执行。
- 容灾演练与正式切换均涉及 DNS 解析切换,存在分钟级传播时延(受 TTL 影响),客户端应用应具备重试与重连能力。
- 本架构提供容灾能力底座,应用层自身需支持无状态化或状态外置,避免依赖本地磁盘状态;容器化工作负载需同步规划镜像仓库跨区域同步。
附录 A. 术语和缩略语
| 术语 | 定义 |
|---|---|
| RPO | Recovery Point Objective,恢复点目标,灾难发生时允许丢失的最大数据量(以时间度量) |
| RTO | Recovery Time Objective,恢复时间目标,从灾难发生到业务恢复可用的最长时间 |
| 保护组 | SDRS 中一组受保护资源的集合,定义源端与容灾端 AZ 的对应关系 |
| 复制对 | SDRS 中源端云硬盘与容灾端副本盘之间的同步复制关系 |
| 灾备实例 | DRS 跨区域实时同步在目标区域维护的数据库备用实例,可一键切换为主用 |
| 待命环境(Staging) | 容灾区域维护的低成本待命资源与数据副本,灾难时经编排拉起为生产环境 |
| 容灾演练 | 在不影响生产的前提下验证容灾环境可恢复性的演练(容灾演练/备份恢复演练) |
| 故障切换(Failover) | 生产区域不可用时,将业务流量与工作负载切换到容灾区域的过程 |
| 回切(Failback) | 生产区域恢复后,将业务与数据从容灾区域迁回生产区域的过程 |
| GTM | Global Traffic Management,DNS 全局流量管理,基于健康检查的区域间流量调度 |
| 备份存储库 | CBR 中存放备份的存储单元,支持跨区域复制与保留策略 |
| 编排 | 以自动化脚本/函数(FunctionGraph)按预定顺序执行恢复动作的流程 |
【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱:
cloudbbs@huaweicloud.com
- 点赞
- 收藏
- 关注作者
评论(0)