一個每週執行的 Dataproc Spark job 在一個 15 節點的叢集上執行約 30 分鐘,並將結果寫入 BigQuery。根據此情境,您應該如何最佳化叢集成本?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 為 Dataproc 叢集使用搶佔式虛擬機器。.
為什麼這是答案
正確答案是為 Dataproc 叢集使用搶佔式虛擬機器。由於此 Spark job 是每週執行一次且執行時間較短 (約 30 分鐘),使用搶佔式虛擬機器 (Preemptible VMs) 可以顯著降低成本。搶佔式虛擬機器提供高達 80% 的折扣,非常適合容錯性高、非關鍵性的批次處理工作負載,即使實例被搶佔,作業也可以重新啟動或從檢查點繼續。 將工作負載遷移到 Cloud Dataflow 可能會增加遷移成本和學習曲線,且不一定能帶來顯著的成本效益,因為 Dataflow 也有其自身的計費模式。使用更高記憶體的節點或將 SSD 連接到 worker 節點雖然可能加快執行速度,但會增加每個節點的成本,對於一個短時間執行的作業來說,可能無法抵消增加的硬體成本。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡