一個磁碟 I/O 密集型的 Hadoop 工作在 Dataproc 上使用 Cloud Storage 作為中介儲存時,執行速度比內部部署裸機 HDFS 慢很多。您如何在分離儲存和運算的情況下解決這個問題?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 佈建更多永久磁碟,並將該工作的中介資料保留在原生 HDFS 上.
為什麼這是答案
此問題描述了在 Dataproc 上使用 Cloud Storage 作為中介儲存時,磁碟 I/O 密集型 Hadoop 工作效能下降的問題。由於 Cloud Storage 的延遲通常高於本機 HDFS,對於需要大量隨機讀寫或頻繁存取小檔案的 I/O 密集型工作,效能會受到影響。 正確答案是佈建更多永久磁碟並將中介資料保留在原生 HDFS 上。這樣做可以利用本機磁碟的低延遲和高吞吐量,顯著提升 I/O 密集型工作的效能。Dataproc 支援將 HDFS 作為暫時儲存層,這正是此類工作所需的。 提供更多記憶體(選項一)對於 I/O 密集型工作幫助有限,因為問題在於磁碟 I/O,而非記憶體不足。增加 VM CPU 核心(選項三)主要影響運算能力,對磁碟 I/O 瓶頸的改善不大,且網路頻寬通常與 CPU 核心數不直接相關。新增額外的 NIC 並使用 OS 連結聚合(選項四)主要用於提高網路吞吐量,對 Cloud Storage 的延遲問題沒有實質幫助,且 Cloud Storage 的存取模式通常透過 API 進行,而非直接透過 NIC 連結。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡