Amazon Athena를 사용하여 Amazon S3의 데이터 세트를 쿼리해야 합니다. 데이터 세트에는 800,000개 이상의 CSV 레코드가 포함되어 있으며, 각 레코드에는 200개의 열이 있고 크기는 약 1.5MB이지만 대부분의 쿼리는 5~10개의 열에만 액세스합니다. 어떤 형식 변환이 쿼리 런타임을 최소화할까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 데이터 세트를 Apache Parquet 컬럼형 형식으로 변환합니다..
이것이 정답인 이유
Apache Parquet은 컬럼형 저장 형식으로, 쿼리가 특정 열에만 액세스할 때 데이터를 효율적으로 읽을 수 있습니다. 이는 쿼리 런타임을 최소화하는 데 핵심적입니다. 80만 개 이상의 레코드와 200개의 열을 가진 대규모 데이터 세트에서 대부분의 쿼리가 5~10개의 열만 필요로 하는 경우, Parquet은 필요한 열만 스캔하여 I/O 및 처리 시간을 크게 줄입니다. JSON 및 XML은 행 기반 형식으로, 불필요한 데이터를 스캔하게 되어 비효율적입니다. GZIP으로 CSV를 압축하는 것은 저장 공간을 절약하지만, 여전히 행 기반 형식이며 필요한 열만 읽는 데 최적화되어 있지 않습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음