Google ACE: 可靠性、备份和灾难恢复 — 学习指南

属于 Google Associate Cloud Engineer — 学习指南. 使用经过验证的答案练习: Google 考试中心, 或参加限时模拟考试: ExamRoll.io.

概述

Google Cloud 上的可靠性、备份和灾难恢复需要在故障域、数据保护机制、流量管理和运维准备方面进行周密的设计。本节将说明如何在可用区和区域之间构建服务,如何保护和恢复有状态数据,以及如何通过规范的运行手册和持续的弹性测试来验证恢复目标。本节还将概述灾难恢复 (DR) 策略的权衡取舍和容量规划,以确保平台能够在定义的恢复时间目标 (RTO) 和恢复点目标 (RPO) 内恢复。

故障域和区域设计

示例:

数据保护:数据库、存储和计算

示例:

示例:

示例生命周期,在 90 天后移至 Coldline 并在 365 天后删除:

流量、容量和依赖项弹性

弹性运营与持续改进

实际问题场景

Brightlane Retail 在 us-central1 运营一个电子商务平台,对可用性有严格要求,且订单数据的 RPO 为四小时。管理层要求能够在可用区中断时无停机,在区域中断时对客户影响最小。

方法:

  1. 部署区域级 MIG,配置 HTTP 自动修复和全局 HTTP(S) 负载均衡器

    • 理由:区域级 MIG 将实例分布在多个可用区,而应用级的 HTTP 健康检查能在连续 3 次(每次 10 秒)检查失败后触发自我修复。全局负载均衡器会自动移除不健康的虚拟机,并将流量故障切换到健康的可用区。
    • 命令: gcloud compute health-checks create http app-hc –check-interval=10s –timeout=5s –unhealthy-threshold=3 –request-path=/healthz gcloud compute instance-groups managed update web-rmig –region=us-central1 –health-check=app-hc –initial-delay=60
  2. 启用 Cloud SQL HA,配置跨区域只读副本和 PITR

    • 理由:区域级 HA (高可用性) 通过自动故障切换提供可用区级别的生存能力。在 us-east1 中的只读副本提供了区域级灾难恢复能力,其 RPO 不为零但有界。启用 PITR(对 MySQL 而言即启用二进制日志)允许恢复到特定时间点,以解决逻辑数据损坏问题。
    • 命令: gcloud sql instances patch orders-mysql –enable-bin-log –backup-start-time=03:00 gcloud sql instances create orders-replica –master-instance-name=orders-mysql –region=us-east1
  3. 使用双区域 Cloud Storage 和生命周期策略保护对象资产

    • 理由:产品图片和静态资产存储在双区域存储桶中,以实现区域级弹性。生命周期转换规则将较旧的工件移动到 Coldline 以优化成本,而版本控制和保留策略可防止关键资产被意外删除。
    • 步骤:启用对象版本控制,为关键存储桶设置 30 天的保留策略,并应用生命周期规则,将非关键的构建工件在 90 天后转换到 Coldline,并在一年后删除。
  4. 为有状态服务安排 PD 快照并创建机器映像

    • 理由:虚拟机磁盘的增量快照提供了快速的崩溃一致性恢复选项。机器映像捕获启动和配置信息,以在区域故障切换期间加速应用服务器的重建。快照时间表确保了基于策略的一致性备份。
    • 命令: gcloud compute resource-policies create snapshot-schedule daily-2am –max-retention-days=14 –on-source-disk-delete=apply-retention-policy –start-time=02:00 gcloud compute disks add-resource-policies app-disk-1 –resource-policies=daily-2am gcloud compute machine-images create app-mi-2024-09-01 –source-instance=app-vm-template
  5. 定义 RTO/RPO 并将 DR 运行手册和 IaC 代码化

    • 理由:为 Web/API 服务设置 15 分钟的 RTO,为订单数据设置 4 小时的 RPO。运行手册详细说明了流量故障切换流程、Cloud SQL 只读副本的提升、DNS 应急预案以及验证步骤。基础设施即代码 (IaC)(如 Terraform/Deployment Manager)可确保确定性的重建过程并减少手动错误。
  6. 在备用区域预配容量和配额

    • 理由:为关键的虚拟机规格创建预留,预先配置备用负载均衡器后端、SSL 证书、NAT 容量,并验证 us-east1 中 Compute、SQL、转发规则和 KMS 的配额。这可以防止在故障切换期间因容量不足而导致失败。
  7. 通过混沌演练验证恢复能力并记录改进点

    • 理由:每季度进行可用区故障演练,以验证 MIG 和 LB 的行为;每半年进行区域疏散演练,将 us-east1 中的只读副本提升为主实例,将全局 LB 指向 us-east1 的后端,并衡量 RTO/RPO。演练的发现将推动改进,例如减少手动步骤或增加副本容量。

通过遵循这些步骤,Brightlane Retail 实现了具备自动自我修复能力的可用区级高可用性,以及具备明确且经过测试的运行手册的区域级灾难恢复态势,从而确保订单数据满足四小时的 RPO 要求,且应用服务在目标 RTO 范围内恢复。


安全性、合规性和数据保护 · 所有领域 · 成本管理、性能和容量优化

练习这些题目 → · 在 ExamRoll.io 上限时练习 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

通过考试 →

浏览 Google →

Related guides

一体化访问

一次订阅。所有考试。

所有计划均可无限制搜索答案、进行模拟测试、获取AI解释以及访问完整的资源库 — 支持20多种语言。

每月
24.87
Just €0.83/day
包含所有内容:
  • 无限答案搜索
  • 无限模拟测试
  • AI驱动的解释
  • 完整资源库
  • 20多种语言
  • 每周内容更新
  • 奖励与推荐
  • 优先支持
开始免费试用

无需信用卡*

最具价值
12个月
179.87
Just €0.49/daySave 40%
包含所有内容:
  • 无限答案搜索
  • 无限模拟测试
  • AI驱动的解释
  • 完整资源库
  • 20多种语言
  • 每周内容更新
  • 奖励与推荐
  • 优先支持
开始免费试用

无需信用卡*

✓ 包含免费计划 · ✓ 随时取消 · ✓ 所有计划均解锁完整产品