ディスクI/Oを多用するHadoopジョブが、オンプレミスのベアメタルHDFSよりも、中間データにCloud Storageを使用するDataprocで大幅に低速で実行されます。ストレージとコンピューティングを分離したまま、これを修正するにはどうすればよいですか?
解答を選択
オプションをタップして解答を確認してください。
正解: より多くの永続ディスクをプロビジョニングし、そのジョブの中間データをネイティブHDFSに保持します。.
これが解答である理由
ディスクI/Oを多用するHadoopジョブがCloud Storageを中間データに使用すると低速になるのは、Cloud StorageへのネットワークアクセスがHDFSのローカルディスクアクセスよりも遅いためです。永続ディスクをプロビジョニングし、中間データをネイティブHDFSに保持することで、データがコンピューティングノードに物理的に近くなり、ディスクI/Oのパフォーマンスが向上します。これにより、ストレージとコンピューティングの分離を維持しつつ、HDFSのローカルディスク速度を活用できます。 メモリを増やすだけでは、中間データがRAMに収まらない場合や、ディスクへの書き込みが必要な場合には効果が限定的です。CPUコアを増やしても、ストレージI/Oのボトルネックは解消されません。NICの追加やリンクアグリゲーションはCloud Storageへのスループットを向上させる可能性がありますが、ネイティブHDFSのローカルディスクI/O速度には及ばないため、根本的な解決にはなりません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要