Google PCD: 可觀測性、偵錯與網站可靠性維運 — 學習指南

屬於 Google Professional Cloud Developer — 學習指南. 使用經過驗證的解答練習: Google 考試中心, 或參加限時模擬考試: ExamRoll.io.

總覽

Google Cloud 中的可觀測性 (Observability)、偵錯與網站可靠性維運 (SRE),其核心在於讓系統變得可衡量、可診斷且具備韌性。強大的可觀測性需要一致的日誌與指標、分散式追蹤、可採取行動的快訊,以及嚴謹的事件應變機制。可靠性則要求明確的服務水準指標 (SLI) 與目標 (SLO)、嚴格的健康狀態信號,以及一個能將線上環境的洞見轉化為工程改進的回饋循環。本節將概述如何在 Google Cloud 中端到端地建構這些能力,並探討如何權衡取捨與分析常見的故障模式。

日誌與監控基礎

Cloud Logging

範例:

undefined

undefined

undefined

undefined

Cloud Monitoring

基於日誌的指標

undefined

維運分析

常見陷阱與權衡

追蹤、錯誤與深度診斷

分散式追蹤

Cloud Trace

Error Reporting

Cloud Profiler

Cloud Debugger

簡短範例:新增 W3C traceparent 並關聯一筆日誌

可靠性工程、警報與健康訊號

SLI、SLO、SLA 與錯誤預算

高品質警報設計

健康檢查與探測 (probe)

undefined

undefined

事件應變、具備安全意識的偵錯與根本原因分析

事件應變生命週期

Runbook (執行手冊)

配額與容量監控

在不洩漏敏感資訊的情況下進行偵錯

跨層的根本原因分析

實務問題情境

Fjord Retail 將其多服務結帳系統遷移至 Google Cloud,使用了 Cloud Run、Cloud SQL、Pub/Sub 以及一個外部的稅務 API。在快閃銷售期間,使用者回報間歇性的逾時和突增的錯誤率,而 on-call 人員收到了充滿雜訊、低信號的警報。

解決方法:

  1. 實作帶有追蹤關聯性的結構化日誌
  1. 建立 Logging 儲存桶、保留政策與匯出
  1. 定義 SLI/SLO 及基於 SLO 的警報
  1. 設定健康探測與綜合檢查
  1. 啟用 Cloud Trace 與 Profiler,並採用帶有退避機制的重試
  1. 監控容量與配額
  1. 強化偵錯的隱私保護
  1. 建立依賴項監控與斷路器
  1. 準備 Runbook 與上報路徑
  1. 事後分析流程

此計畫能提升信號品質、縮短偵測與解決時間、在流量高峰時保護使用者體驗,並在生產環境偵錯時強制執行隱私保護。


持續交付、組態與基礎設施自動化 · 所有領域 · 效能、可擴展性與韌性工程

練習這些題目 → · 在 ExamRoll.io 上限時練習 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

通過考試 →

瀏覽 Google →

Related guides

一站式存取

一份訂閱。所有考試。

每個方案都可無限存取答案搜尋、練習測驗、AI 解釋和完整的資源庫 — 支援 20 多種語言。

每月
24.87
Just €0.83/day
包含所有內容:
  • 無限答案搜尋
  • 無限練習測驗
  • AI 驅動的解釋
  • 完整資源庫
  • 20 多種語言
  • 每週內容更新
  • 獎勵與推薦
  • 優先支援
開始免費試用

無需信用卡*

最佳價值
12 個月
179.87
Just €0.49/daySave 40%
包含所有內容:
  • 無限答案搜尋
  • 無限練習測驗
  • AI 驅動的解釋
  • 完整資源庫
  • 20 多種語言
  • 每週內容更新
  • 獎勵與推薦
  • 優先支援
開始免費試用

無需信用卡*

✓ 包含免費方案 · ✓ 隨時取消 · ✓ 所有方案解鎖完整產品