많은 셔플이 있는 Dataproc Spark 작업이 각각 약 200~400MB 크기의 Parquet 파일을 읽고, 두 개의 비선점형 노드만 있는 선점형 작업자에서 실행됩니다. 비용 효율적으로 성능을 개선하려면 어떤 변경을 해야 할까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: HDD에서 SSD로 전환하고, 선점형 VM 구성을 재정의하여 부팅 디스크 크기를 늘립니다..
이것이 정답인 이유
정답은 HDD에서 SSD로 전환하고, 선점형 VM 구성을 재정의하여 부팅 디스크 크기를 늘리는 것입니다. Spark 작업은 많은 셔플과 작은 Parquet 파일을 처리하므로 I/O 집약적입니다. SSD는 HDD보다 훨씬 빠른 I/O 성능을 제공하여 이러한 병목 현상을 해결합니다. 또한, 부팅 디스크 크기를 늘리면 Spark 작업 중 발생하는 임시 셔플 데이터 저장 공간이 확보되어 디스크 공간 부족으로 인한 성능 저하를 방지할 수 있습니다. Parquet 파일 크기를 1GB로 늘리는 것은 파일 개수를 줄여 오버헤드를 감소시키지만, 작은 파일 처리의 근본적인 I/O 병목 현상을 해결하지는 못합니다. TFRecords 형식으로 전환하는 것은 파일 크기가 비슷하여 큰 성능 개선을 기대하기 어렵습니다. HDFS로 데이터를 복사하는 것은 추가적인 데이터 이동 오버헤드를 발생시켜 비용 효율적이지 않으며, GCS에서 직접 데이터를 읽는 것이 더 효율적입니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음