一个磁盘 I/O 密集型 Hadoop 作业在 Dataproc 上使用 Cloud Storage 作为中间存储时,运行速度比在本地裸机 HDFS 上慢得多。如何在分离存储和计算的同时解决这个问题?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 预置更多持久性磁盘,并将该作业的中间数据保存在原生 HDFS 上.
为什么这是答案
磁盘 I/O 密集型作业在 Dataproc 上使用 Cloud Storage 作为中间存储时变慢,是因为 Cloud Storage 相比本地 HDFS 具有更高的延迟和更低的吞吐量,这会成为 I/O 瓶颈。将中间数据保存在原生 HDFS 上,可以利用本地磁盘的低延迟和高吞吐量,从而显著提高作业性能。为集群提供更多内存虽然可以缓存部分数据,但对于大型中间数据集效果有限。增加 VM CPU 核数主要影响计算能力,对 I/O 瓶颈帮助不大。添加额外的 NIC 和链路聚合主要提升网络带宽,对 Cloud Storage 的访问延迟改善有限,且原生 HDFS 的本地 I/O 性能远超网络传输。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡