Google PCA: 迁移、现代化与混合云策略 — 学习指南

属于 Google Professional Cloud Architect — 学习指南. 使用经过验证的答案练习: Google 考试中心, 或参加限时模拟考试: ExamRoll.io.

概述

一个成功的迁移、现代化和混合云战略,需要将平台选择与业务成果对齐,同时管理可用性、数据完整性、延迟、安全性和成本等方面的风险。该路径在快速平移(rehost)以降低数据中心风险与有针对性的重构(refactor)以获取云优势之间取得平衡。运营模式必须与技术同步发展,以维持改进。本节提供了一个实用的蓝图,涵盖评估和批次规划、决策框架、迁移机制、混合集成、现代化模式、策略和多云考量,以及迁移后优化,并重点关注故障模式和权衡。

评估、就绪度和批次规划

常见故障模式:未知的同步依赖在切换后导致级联超时;IP 范围重叠导致连接中断;许可合规性差距;缺乏回滚对等性,导致数据突变无法撤销。

迁移模式、数据移动和切换

undefined

- 在 Linux ext4 上:

undefined

undefined

常见故障模式:Cloud VPN 上的数据包丢失中断数据库复制(应使用 Dedicated Interconnect 或 Partner Interconnect)、切换期间的双写数据不一致、缺少健康检查导致滚动更新中止。

混合身份、连接和本地集成

undefined

常见故障模式:CIDR 重叠导致路由阻塞、BGP 会话冗余不足、公共 DNS 或出口泄漏暴露了私有服务、以及未预料到的“话痨”协议在高延迟链路上性能不佳。

现代化、运营模型与优化

实践问题场景

Acme 气象网络公司必须将其リアルタイム传感器平台和一个遗留的 J2EE 管理界面从本地数据中心迁移到 Google Cloud。该系统从 50,000 个传感器注入数据,每个传感器每秒发送 10 个读数,并存储五年的历史数据(75 TB)。在过渡期间,它必须保持对本地 ERP 和 Active Directory 的私有访问,最大限度地减少本地 MySQL 数据库的停机时间,并消除通过 VPN 观察到的间歇性复制失败问题。

  1. 建立安全着陆区

    • 创建组织、文件夹以及生产/非生产项目。设置一个 Shared VPC,其 IP 范围不与本地重叠,以确保通过混合连接实现本地可达性。应用组织策略并将审计日志集中导出到 BigQuery,并配置最小权限访问。
    • 理由:在工作负载部署之前,防止路由冲突并强制执行基线治理。
  2. 实施混合身份

    • 配置 Google Cloud Directory Sync 以同步 AD 身份和组,并设置 SAML SSO。为平台和工作负载使用服务账号和 IAM 自定义角色。
    • 理由:保留企业身份作为事实来源,并实现最小权限访问控制。
  3. 配置连接并规划性能

    • 开发/测试环境先使用 HA Cloud VPN。对于生产数据库复制和稳定的传感器数据注入,配置 Dedicated Interconnect,并配备双 VLAN 连接和 BGP 会话。
    • 理由:Interconnect 提供比 VPN 更低的延迟和更少的数据包丢失,从而稳定 MySQL 复制和流式数据注入。
  4. 高效迁移历史数据

    • 订购 Transfer Appliances,在本地加载 75 TB 数据集,然后运送并在 Cloud Storage 中恢复数据。如果需要,使用 Storage Transfer Service 进行持续的增量更新。在存入 Bigtable 或 BigQuery 之前,对支持日志运行 Cloud DLP 以对 PII 进行去标识化处理。
    • 理由:离线批量传输可降低切换窗口风险,并避免网络链路饱和。
  5. Rehost J2EE 管理界面

    • 使用 Migrate to Virtual Machines 将 J2EE VM 直接迁移到 Compute Engine。将实例放置在 HTTP(S) 负载均衡器后面的托管实例组中。通过标签应用防火墙规则,以强制执行仅限 web→API→DB 的流量流向。例如:

undefined

  1. 以最短停机时间将 MySQL 迁移到 Cloud SQL

    • 在源端进行性能基准测试并启用二进制日志。使用 Database Migration Service 设置到 Cloud SQL 的持续复制。启用存储空间自动增加,并为 CPU 接近 75% 和复制延迟低于 60 秒创建警报。
    • 理由:在线迁移可实现低停机时间;托管 SQL 可减少繁琐工作并强制执行运营 SLO。
  2. 执行受控切换

    • 提前 48 小时降低 DNS TTL,冻结 schema 变更,并安排维护窗口。停止本地写入,确保 DMS 延迟为零,运行校验和及应用冒烟测试,然后将客户端指向 Cloud SQL。维护一个回滚计划,以便在验证失败时可以将写入重定向回本地。
    • 理由:确定性的步骤可限制 RTO 并保持数据一致性。
  3. 构建实时遥测数据注入管道

    • 通过 Pub/Sub 注入数据,使用 Dataflow 进行处理,并将时间序列数据存储在 Bigtable 中以实现低延迟的写入和读取。通过 Interconnect 保持与 ERP 的集成是私有的。
    • 理由:Bigtable 匹配高吞吐量的时间序列场景,而 Pub/Sub 将突发性的生产者与消费者解耦。
  4. 容器化服务并引入 CI/CD

    • 为 GKE 容器化无状态服务。通过使用精简基础镜像和优化层顺序(使依赖安装先于源代码复制)来优化 Dockerfile。实施一个 CI/CD 管道,包含在暂存环境的自动化测试和金丝雀部署。以最短停机时间进行更新:

undefined

  1. 增强可观测性与审计

    • 使用 Cloud Logging、Monitoring 和 Trace 进行插桩,以精确定位跨微服务的延迟。将审计日志导出到 BigQuery,并共享限定了审计员范围的视图。将长期指标导出到 Cloud Storage,以满足五年的保留要求。
    • 理由:全保真遥测数据为 SLO 和合规性提供支持。
  2. 优化与下线

    • 在 MIG 和 GKE 上启用自动扩缩,合理调整实例规模,应用承诺使用折扣,并将非 24x7 的工作负载(例如辅助任务)安排在无服务器上(如 Cloud Functions)以实现缩容至零。在系统稳定并经过冷却期后,下线本地系统,更新 CMDB,并公布已实现的收益。
    • 理由:在消除双重运行开销的同时,实现成本和运营效率。
  3. 投入运营与培训

    • 最终确定运行手册、RACI、待命轮换以及 SLO/错误预算。提供有针对性的培训和认证计划以弥补技能差距。优先使用 Terraform 作为 IaC 工具;注意 Deployment Manager 是 Google 特有的,可能无法处理非 Google 资源。
    • 理由:成熟的运营模型能够在迁移事件之后持续保持可靠性和开发速度。

可靠性、灾难恢复与业务连续性 · 所有领域 · 运维、可观测性与平台自动化

练习这些题目 → · 在 ExamRoll.io 上限时练习 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

通过考试 →

浏览 Google →

Related guides

一体化访问

一次订阅。所有考试。

所有计划均可无限制搜索答案、进行模拟测试、获取AI解释以及访问完整的资源库 — 支持20多种语言。

每月
24.87
Just €0.83/day
包含所有内容:
  • 无限答案搜索
  • 无限模拟测试
  • AI驱动的解释
  • 完整资源库
  • 20多种语言
  • 每周内容更新
  • 奖励与推荐
  • 优先支持
开始免费试用

无需信用卡*

最具价值
12个月
179.87
Just €0.49/daySave 40%
包含所有内容:
  • 无限答案搜索
  • 无限模拟测试
  • AI驱动的解释
  • 完整资源库
  • 20多种语言
  • 每周内容更新
  • 奖励与推荐
  • 优先支持
开始免费试用

无需信用卡*

✓ 包含免费计划 · ✓ 随时取消 · ✓ 所有计划均解锁完整产品