Google PDE: 資料儲存、資料湖與檔案格式 — 學習指南

屬於 Google Professional Data Engineer — 學習指南. 使用經過驗證的解答練習: Google 考試中心, 或參加限時模擬考試: ExamRoll.io.

總覽

Google Cloud 上的資料儲存涵蓋了原始物件儲存、經整理的資料湖,以及為分析最佳化的格式。要建立可靠、受監管且高效能的資料湖,需要在儲存空間級別、值區設定、位置、檔案格式、資料表佈局和生命週期方面謹慎選擇。本節詳述了設計上的權衡取捨、應避免的故障模式,以及能與 BigQuery、Spark 和大規模串流管道對齊的模式。

Cloud Storage 基礎:級別、值區、一致性和生命週期

Cloud Storage 是儲存原始檔案和經整理檔案的耐用、高可用性基礎。

使用 BigLake 和 Dataplex 進行統一的資料湖治理

BigLake 和 Dataplex 將跨檔案和資料表的安全性和治理標準化。

檔案格式、壓縮與查詢行為

選擇正確的格式對成本與效能有著最直接的影響。

版面配置、分割、效能工程、駐留性與遷移

undefined

實務問題情境

Acme Retail 每天從物流合作夥伴接收 CSV 檔案,這些檔案會被投放到一個區域級的 Cloud Storage bucket 中。檔案偶爾會包含格式錯誤的資料列。Acme 必須將資料落地、驗證、轉換為適合分析的格式,並載入到 BigQuery 以支援近乎即時的儀表板,同時保留錯誤的資料列以供檢查,並強制執行治理。

方法:

  1. 在 Dataplex 中落地並治理原始資料

    • 建立一個 Dataplex lake,並將一個 raw zone asset 對應到 gs://acme-raw/logistics/。
    • 理由:集中化的治理、中繼資料和資料血緣。在 zone 層級強制執行 IAM,並使用 policy tags 標記敏感欄位,以便下游系統強制執行。
  2. 強制執行生命週期與保留政策

    • 在 acme-raw 上套用 30 天的 bucket 保留政策,並啟用物件版本控制。
    • 理由:保護資料免於合作夥伴的意外覆寫/刪除;較短的保留期能在成本與可復原性之間取得平衡。版本控制有助於回復錯誤的交付內容。
  3. 使用 Dataflow 批次管道進行驗證與擷取

    • 透過物件完成通知來觸發每日的 Dataflow 作業。使用 schema 讀取 CSV 並進行逐筆記錄驗證;將有效的記錄寫入 BigQuery 的中繼站(依 event_date 分割),並將解析/驗證錯誤的資料路由到一個 dead-letter BigQuery 資料表。
    • 理由:Dataflow 提供可擴展的平行解析和強健的 dead-letter 處理機制,讓分析師可以檢查錯誤的資料列。這反映了處理品質不一的 CSV 檔案的最佳實踐。
  4. 在 curated zone 中壓縮並轉換為 Parquet 格式

    • 同一個管道將已驗證的資料以 Parquet 格式寫入 gs://acme-curated/logistics/date=YYYY-MM-DD/,檔案大小約為 256–512 MB。
    • 理由:Parquet 讓 BigQuery 和 Spark 能夠進行欄位修剪和述詞下推,從而降低掃描的位元組數並改善延遲;壓縮則緩解了因合作夥伴交付模式所造成的小檔案開銷。
  5. 透過 BigLake 提供受監管的分析資料

    • 在 curated Parquet 路徑上建立一個 BigLake 外部資料表,並啟用 Hive 自動分割;套用欄位級的 policy tags 和資料列存取政策,以實現針對特定合作夥伴的篩選。
    • 理由:在 BigQuery 和 Spark 之間實現統一的細粒度存取,並進行集中式稽核。分割區修剪可降低基於日期篩選的掃描成本。
  6. 將關鍵彙總資料載入原生 BigQuery

    • 對於熱門儀表板,執行一個排程的 BigQuery 作業,將 curated Parquet 外部資料表中最近 N 天的資料擷取到一個原生的叢集化、分割化資料表中。
    • 理由:原生儲存能加速高並行性的 BI,而外部 BigLake 資料表則作為受監管的記錄系統,供更廣泛的存取使用。
  7. 使用 Cloud Logging 和 Pub/Sub 進行監控與警示

    • 建立一個 log sink,將 Dataflow 和 BigQuery 載入作業的結果篩選到 Pub/Sub;與監控工具整合,以便在發生故障或錯誤資料列比率升高時立即發出警示。
    • 理由:無需輪詢即可獲得針對特定資料表的營運可見性;支援 SRE 實踐。
  8. 優化儲存類別與駐留性

    • 將 curated Parquet 在 Standard 儲存類別中保留 14 天,30 天後透過生命週期規則轉換到 Coldline;將 raw 和 curated bucket 與 BigQuery dataset 儲存在同一區域,以避免出口流量費用。
    • 理由:在熱讀取效能與成本之間取得平衡。共置一處可維持合規性,並將延遲和出口流量費用降至最低。
  9. 驗證端到端的品質

    • 每次執行後,比較 staging、curated external 和原生 BigQuery 資料表之間的計數與雜湊彙總值;隔離異常情況。
    • 理由:及早偵測 schema 變動或擷取迴歸問題;密碼學或指紋雜湊能在無需完整重新掃描的情況下,提供輕量級的保證。

此設計提供了具備 dead-letter 分析能力的彈性擷取機制、可用於高效查詢且適合分析的 Parquet 格式、透過 Dataplex 和 BigLake 實現的集中式治理,以及成本優化的生命週期政策,同時完全遵循最小權限存取和可稽核的操作原則。


資料工程架構與設計 · 所有領域 · BigQuery 分析與倉儲工程

練習這些題目 → · 在 ExamRoll.io 上限時練習 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

通過考試 →

瀏覽 Google →

Related guides

一站式存取

一份訂閱。所有考試。

每個方案都可無限存取答案搜尋、練習測驗、AI 解釋和完整的資源庫 — 支援 20 多種語言。

每月
24.87
Just €0.83/day
包含所有內容:
  • 無限答案搜尋
  • 無限練習測驗
  • AI 驅動的解釋
  • 完整資源庫
  • 20 多種語言
  • 每週內容更新
  • 獎勵與推薦
  • 優先支援
開始免費試用

無需信用卡*

最佳價值
12 個月
179.87
Just €0.49/daySave 40%
包含所有內容:
  • 無限答案搜尋
  • 無限練習測驗
  • AI 驅動的解釋
  • 完整資源庫
  • 20 多種語言
  • 每週內容更新
  • 獎勵與推薦
  • 優先支援
開始免費試用

無需信用卡*

✓ 包含免費方案 · ✓ 隨時取消 · ✓ 所有方案解鎖完整產品