GoogleGoogle Professional Data Engineer (PDE) Certification
·TW
·更新於 21 Aug 2026
部署新版資料擷取管道後,BigQuery 中每日儲存的資料量增加了 50%,Pub/Sub 的資料量則保持不變,且只有部分每日分區的資料量翻倍。您會如何調查並補救這個問題?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 1. 檢查 BigQuery 資料表中每日分區資料量翻倍的重複資料列。2. 檢查 BigQuery 稽核日誌以尋找工作 ID。3. 使用 Cloud Monitoring 判斷已識別的 Dataflow 工作何時啟動以及管道程式碼版本。4. 當有多個管道將資料擷取到一個資料表時,停止所有版本,只保留最新版本。.
為什麼這是答案
此情境表明資料重複,因為 BigQuery 資料量增加而 Pub/Sub 資料量不變。正確答案提供了一個系統性的調查和補救流程。首先,檢查 BigQuery 中重複的資料列以確認問題。接著,透過 BigQuery 稽核日誌追蹤是哪個工作導致了重複。然後,利用 Cloud Monitoring 識別相關 Dataflow 工作的啟動時間和程式碼版本,這對於找出問題的根源至關重要。最後,如果有多個管道寫入同一張表,停止舊版本並只保留最新版本可以防止未來的重複寫入。
其他選項的錯誤之處在於:
選項一和二:雖然檢查重複資料和程式碼錯誤是好的開始,但它們沒有提供足夠的診斷步驟來找出根本原因,例如是哪個工作或哪個版本的程式碼導致了問題。簡單地排程重複資料刪除或回溯並不能解決潛在的管道配置問題。
選項四:回溯部署和使用時間旅行恢復資料表是最後的手段,而不是調查問題的首選步驟。在沒有充分理解問題原因的情況下重播訊息可能會導致再次出現重複。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 →
無需信用卡