Google Professional Data Engineer — 學習指南
邊學邊練。 每個概念都對應 Google 考試中心中附有驗證解答的真實考題,或在 ExamRoll.io 上透過限時練習演練整場考試。
本指南深入講解每個 PDE 領域。選擇一個領域深入學習,或依序逐一學習。
領域
- 資料工程架構與設計 — 在 Google Cloud 上進行資料工程的架構與設計,需要在領域邊界、處理模式與服務能力之間取得平衡,以交付可靠、可擴展且具成本效益的資料平台。有效的設計能讓儲存、運算、協調與服務層能夠獨立擴展;將合約程式碼化以使各領域能互相操作;並透過可衡量的服務等級目標 (SLO)
- 資料儲存、資料湖與檔案格式 — Google Cloud 上的資料儲存涵蓋了原始物件儲存、經整理的資料湖,以及為分析最佳化的格式。要建立可靠、受監管且高效能的資料湖,需要在儲存空間級別、值區設定、位置、檔案格式、資料表佈局和生命週期方面謹慎選擇。本節詳述了設計上的權衡取捨、應避免的故障模式,以及能與 BigQuery、Spark
- BigQuery 分析與倉儲工程 — BigQuery 是一個無伺服器、以欄為基礎 (columnar) 的大規模平行處理 (MPP) 分析倉儲,它將儲存與運算分離,提供近乎無限的擴展性、ANSI SQL 及整合式治理。在 BigQuery
- 使用 Dataflow 與 Apache Beam 進行串流處理 — Google Cloud 上的串流處理,核心是圍繞著由 Dataflow 執行器所執行的 Apache Beam 統一程式設計模型。Beam 提供了一個邏輯上的抽象層——在 PCollection 上進行轉換的
- 訊息傳遞、事件擷取與即時服務 — Google Cloud 上的訊息傳遞、事件擷取與即時服務,其核心為用於解耦、持久傳輸的 Cloud Pub/Sub 和 Eventarc;用於具狀態串流處理的 Dataflow;以及如 BigQuery、Cloud Storage 和營運資料庫等匯集點
- Spark、Dataproc 與分散式資料處理 — Google Cloud Dataproc 上的 Apache Spark 為分散式資料處理提供了一個託管式、具彈性的平台。您可以根據控制需求、執行時間的變動性以及管理負擔,在長時間執行的叢集、臨時性 Dataproc 叢集與 Dataproc Serverless for Spark
- 資料擷取、整合與遷移 — 在 Google Cloud 中,資料擷取、整合與遷移涵蓋了可重複的模式、託管服務與操作控制,能將多樣的來源系統轉化為可靠、可查詢的資料集。有效的設計會將傳輸與轉換分離、將生產者與消費者解耦,並偏好使用具備冪等性、檢查點、清晰血緣關係與驗證機制的管線。本節將涵蓋擷取模式、用於資料移動和 CDC 的
- 工作流程編排與管線自動化 — 回填 (Backfills)、追補 (Catchup) 與故障處理 - 當任務具備冪等性且來源資料已按日期分區時,啟用追補 (catchup) 功能以重新計算歷史資料。對於非確定性輸出或有外部副作用的情況,請考慮使用僅供回填的 DAG 或寫入稽核表來追蹤已產生的內容。 -
- 機器學習、AI 與資料服務 — - 模型建立:使用
CREATE MODEL搭配明確的標籤欄位和特徵轉換,以避免資料洩漏並標準化輸入。 範例: CREATE OR REPLACE MODEL ds.churn_model OPTIONS( model_type=‘logistic_reg’, - 資料治理、安全性、可靠性與成本營運 — 本節總結了在 Google Cloud 上進行資料治理、安全性、可靠性與成本營運的設計模式及操作實務。內容聚焦於 BigQuery、Cloud Storage、Dataflow、Dataplex
準備好練習了嗎?
- 瀏覽所有附驗證解答的題目 → — 免費,含解析。
- 在 ExamRoll.io 上開始限時模擬考試 → — 完整題庫,支援 20 多種語言。
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
通過考試 →