GoogleGoogle Professional Data Engineer (PDE) Certification
·TW
·更新於 21 Aug 2026
您有內部部署的 Spark 任務,每天處理 Parquet 檔案。遷移到 Google Cloud 後,您希望使用受管理的服務、將 ETL 變更降到最低,並讓 BigQuery 可用於未來的資料管道。您應該怎麼做?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 將資料遷移到 Cloud Storage,並將中繼資料遷移到 Dataproc Metastore (DPMS)。重構 Spark 任務以讀取/寫入 Cloud Storage,並在 Dataproc Serverless 上執行。.
為什麼這是答案
正確答案符合所有要求。將 Parquet 檔案遷移到 Cloud Storage 提供了可擴展且經濟高效的儲存。將中繼資料遷移到 Dataproc Metastore (DPMS) 確保了 Spark 任務可以繼續使用現有的中繼資料定義,最大限度地減少了 ETL 更改。在 Dataproc Serverless 上執行重構後的 Spark 任務,提供了全託管、無伺服器且按使用量付費的 Spark 執行環境,避免了管理叢集的開銷。這也使得 BigQuery 可以透過 BigLake 功能輕鬆查詢 Cloud Storage 中的資料,滿足未來的資料管道需求。
將儲存桶註冊為 Dataplex 資產雖然有助於資料治理,但不能替代 DPMS 來管理 Spark 任務所需的中繼資料。將資料直接遷移到 BigQuery 需要對 Spark 任務進行重大重構,以適應 BigQuery 的讀寫模式,這與「最大限度地減少 ETL 更改」的目標相悖。在 Compute Engine 上的 Dataproc 上執行會增加管理 VM 的開銷,而不是使用託管的 Dataproc Serverless。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 →
無需信用卡