Google PCD: 成本、治理和可持续应用运维 — 学习指南

属于 Google Professional Cloud Developer — 学习指南. 使用经过验证的答案练习: Google 考试中心, 或参加限时模拟考试: ExamRoll.io.

概述

在现代 Google Cloud 应用开发中,成本、治理和可持续运营是密不可分的。其目标是揭示和控制支出,设计可经济扩展的服务,并强制实施护栏以保持环境的安全、合规和整洁——同时平衡性能和可靠性。本节详细介绍了实用机制(结算和标签、自动扩缩容的调节、配额和策略)、特定工作负载的经济性(Cloud Run、GKE、数据平台),以及在不损害用户体验的情况下减少闲置浪费和碳影响的可持续性选择。

成本控制与可见性

示例:添加标签 gcloud compute instances update web-01 –labels=team=payments,app=checkout,env=prod

示例:列出 Compute Engine 配额 gcloud services quota list
–service=compute.googleapis.com
–consumer=projects/$PROJECT_ID

弹性与计算经济性

示例:Cloud Run 配置 (service.yaml) apiVersion: serving.knative.dev/v1 kind: Service metadata: name: img-api annotations: autoscaling.knative.dev/minScale: “2” spec: template: spec: containerConcurrency: 40 containers: - image: gcr.io/PROJECT/img-api resources: limits: memory: “512Mi”

示例:带 requests/limits 的 GKE deployment apiVersion: apps/v1 kind: Deployment metadata: name: api spec: replicas: 3 template: spec: containers: - name: api image: gcr.io/PROJECT/api:stable resources: requests: cpu: “500m” memory: “512Mi” limits: cpu: “1” memory: “768Mi”

数据、分析和网络成本治理

示例:Cloud Storage 生命周期

undefined

示例:限制查询成本

undefined

组织治理与环境规整

实际问题场景

NimbusMarket 是一家电子商务公司,在闪购期间会经历流量尖峰,同时其分析支出也在不断增长。他们在 Cloud Run 上运行客户 API,在 GKE 上运行后台工作程序,并在 BigQuery 中进行产品分析。领导层要求在不影响 99.9% API SLO 的前提下,将成本降低 25%。

方法:

  1. 建立成本可见性和护栏

    • 为结算账号创建预算,并在预测支出达到 60%、90% 和 100% 时设置告警,通过 Pub/Sub 将通知路由给值班人员。
    • 标准化标签(team、app、env、cost-center)并通过对 Terraform 计划的 CI 检查来强制执行;添加一项组织政策,将资源位置限制在已批准的区域内。 理由:预算提供预警;标签可以生成各团队的报告;政策可以防止意外使用高出站流量费用的区域并提高合规性。
  2. 调整 Cloud Run 以实现经济高效的扩缩

    • 在性能分析确认平均 CPU 时间为 30 毫秒且 IO 非阻塞后,将无状态 API 的 containerConcurrency 设置为 40。将 minScale=2 配置为在正常时段避免冷启动;设置一个计划策略,在夜间将 minScale 降至 0。 理由:更高的并发性可提高利用率并减少实例数量;保持最少的稳定实例可以在有限的基线成本下维护 SLO,并在非工作时间移除这部分成本。
  3. 为 GKE 工作负载分配合理的资源并启用高效的自动扩缩

    • 根据性能分析,为工作程序 Pod 应用 500m CPU/512Mi 的 requests 和 1 CPU/768Mi 的 limits。基于队列深度和处理延迟启用 HPA,并以推荐模式启用 VPA 来迭代优化 requests。验证 PodDisruptionBudgets 允许缩容。在节点池上启用 Cluster Autoscaler,并使用多个较小的节点。 理由:准确的 requests 能驱动有效的调度和自动扩缩;HPA 使容量与积压任务量对齐;VPA 避免资源请求漂移;多个小节点可减少闲置容量并加快扩缩事件的速度。
  4. 为容错批处理采用 Spot 容量

    • 将图像缩略图生成任务迁移到采用 Spot 实例并带有检查点机制的节点池。实现 preStop 钩子以刷出正在处理的工作,并使用一个控制器来重新调度被中断的作业。 理由:缩略图生成是幂等且时间灵活的,这使其成为利用 Spot 实例节省成本的理想选择,且对用户体验影响极小。
  5. 降低分析扫描成本并隔离工作负载

    • 按 event_date 和 customer_id 对事件表进行分区和聚类。为原始事件添加 180 天后过期的表设置。将市场分析师分配到一个带有槽位上限的独立 BigQuery 预留中;在他们的计划查询中强制执行 maximum_bytes_billed。将夜间报告转换为批处理优先级。 理由:分区和聚类可以限制每次查询的字节数;过期策略强制执行治理;预留可以隔离“吵闹邻居”;批处理可以减少非紧急作业的资源争用和成本。
  6. 优化存储生命周期和出站流量

    • 将产品图片存储在靠近客户的双区域中;通过生命周期规则将 30 天未访问的图片移动到 Coldline;通过 Cloud CDN 提供服务。将 Cloud Run 服务与 Cloud SQL 部署在同一区域,并启用 Private Service Connect 以连接到 Google API。 理由:CDN 减少了出站流量和延迟;生命周期管理将冷内容转移到更便宜的存储;同地部署可最大限度地减少出站流量并提高性能。
  7. 实施清理自动化和可持续性检查

    • 为临时环境标记 ttl-hours 标签,并每晚运行一个 Cloud Run 作业来删除过期资源。使用 Carbon Footprint 报告来考虑将批处理作业迁移到碳排放更低的区域,并将其安排在非高峰碳排放时段运行。 理由:自动化清理可防止成本泄漏;碳感知调度可在不影响 SLO 的情况下减少对环境的影响。
  8. 通过 SLO 感知负载测试和成本模型进行验证

    • 运行负载测试,重放闪购模式的流量;验证 p95 延迟和错误预算。使用账单导出信息中心比较优化前后的成本。 理由:确认调优在满足可靠性目标的同时,也带来了与目标一致的可衡量成本节省。

通过执行这些步骤,NimbusMarket 使支出与需求保持一致,防止了资源闲置浪费,并强制执行了治理,从而在保持 99.9% API SLO 的同时,实现了目标成本节省并改善了可持续性状况。


测试、质量工程和安全发布管理 · 所有领域

练习这些题目 → · 在 ExamRoll.io 上限时练习 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

通过考试 →

浏览 Google →

Related guides

一体化访问

一次订阅。所有考试。

所有计划均可无限制搜索答案、进行模拟测试、获取AI解释以及访问完整的资源库 — 支持20多种语言。

每月
24.87
Just €0.83/day
包含所有内容:
  • 无限答案搜索
  • 无限模拟测试
  • AI驱动的解释
  • 完整资源库
  • 20多种语言
  • 每周内容更新
  • 奖励与推荐
  • 优先支持
开始免费试用

无需信用卡*

最具价值
12个月
179.87
Just €0.49/daySave 40%
包含所有内容:
  • 无限答案搜索
  • 无限模拟测试
  • AI驱动的解释
  • 完整资源库
  • 20多种语言
  • 每周内容更新
  • 奖励与推荐
  • 优先支持
开始免费试用

无需信用卡*

✓ 包含免费计划 · ✓ 随时取消 · ✓ 所有计划均解锁完整产品