您想要使用無伺服器、基於 SQL 的方法重建緩慢的 PySpark 批次管道。原始資料位於 Cloud Storage 中。您應該如何實作管道以加速開發和執行時間?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 將資料從 Cloud Storage 載入到 BigQuery 中,將 PySpark 轉換翻譯為 BigQuery SQL,然後將結果寫入新的 BigQuery 資料表。.
為什麼這是答案
正確答案是將資料從 Cloud Storage 載入到 BigQuery 中,將 PySpark 轉換翻譯為 BigQuery SQL,然後將結果寫入新的 BigQuery 資料表。這種方法利用 BigQuery 的無伺服器架構和高效能 SQL 引擎,顯著加速開發和執行時間。將 PySpark 轉換為 BigQuery SQL 能夠利用 BigQuery 的優化查詢處理能力。 選項一將 PySpark 命令轉換為 SparkSQL 並在 Dataproc 上執行,雖然可行,但 Dataproc 仍需管理叢集,不符合無伺服器要求。選項二將資料攝取到 Cloud SQL 中,會增加資料移動的複雜性和成本,且 Cloud SQL 不適合大規模分析,BigQuery 的聯合查詢也無法彌補其效能瓶頸。選項四使用 Apache Beam Python SDK 重新實作轉換,雖然是無伺服器選項,但需要重新編寫整個管道,開發成本較高,且 BigQuery SQL 通常能提供更快的執行速度。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡