한 회사에서 데이터 레이크로 Amazon S3를, 데이터 웨어하우스로 Amazon Redshift를 사용하는 분석 플랫폼을 구축하고 있습니다. 이 회사는 Amazon Redshift Spectrum을 사용하여 S3 데이터를 쿼리하려고 합니다. 어떤 작업이 가장 빠른 쿼리 성능을 제공할까요? (두 가지 선택)
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 컬럼형 스토리지 파일 형식을 사용합니다., 가장 일반적인 쿼리 조건자를 기반으로 데이터를 분할합니다..
이것이 정답인 이유
컬럼형 스토리지 파일 형식(예: Parquet 또는 ORC)을 사용하면 Redshift Spectrum이 필요한 열만 읽을 수 있어 I/O 작업이 줄어들어 쿼리 성능이 크게 향상됩니다. 가장 일반적인 쿼리 조건자를 기반으로 데이터를 분할하면 Redshift Spectrum이 스캔해야 하는 데이터 양을 줄여 쿼리 실행 시간을 단축할 수 있습니다. 개별 파일을 gzip 압축을 사용하여 1GB에서 5GB 사이의 크기로 압축하는 것은 좋은 방법이지만, 컬럼형 스토리지와 파티셔닝만큼 직접적인 성능 향상을 제공하지는 않습니다. 데이터를 10KB 미만의 파일로 분할하면 S3 객체 수가 너무 많아져 오버헤드가 발생하고 쿼리 성능이 저하될 수 있습니다. 분할할 수 없는 파일 형식은 Redshift Spectrum의 병렬 처리 기능을 활용할 수 없어 성능에 부정적인 영향을 미칩니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음