한 ML 엔지니어가 두 가지 워크로드에 Amazon Athena를 사용하는 파이프라인을 구축해야 합니다. 하나는 대규모 배치 변환 및 모델 훈련용이고, 다른 하나는 추론 및 분석을 위한 거의 실시간의 낮은 지연 시간 쿼리용입니다. 배치 및 거의 실시간 처리 모두에서 가장 낮은 지연 시간을 생성하는 파일 형식은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: Apache Parquet.
이것이 정답인 이유
Apache Parquet은 컬럼 기반의 압축된 파일 형식으로, 대규모 데이터 세트에서 분석 쿼리 성능을 최적화합니다. 컬럼 기반 저장 방식은 필요한 컬럼만 읽을 수 있게 하여 I/O를 줄이고, 효율적인 압축은 스토리지 비용과 데이터 전송 시간을 절약합니다. 이는 배치 변환 및 모델 훈련과 같은 대규모 워크로드뿐만 아니라, 특정 컬럼에 대한 빠른 접근이 필요한 거의 실시간 쿼리에서도 낮은 지연 시간을 제공합니다. CSV는 행 기반 형식으로, 모든 데이터를 읽어야 하므로 분석 쿼리에서 비효율적입니다. Nested JSON과 Deserialized JSON은 유연하지만, Parquet만큼 압축 효율성과 쿼리 성능이 뛰어나지 않습니다. 특히 Deserialized JSON은 데이터가 이미 역직렬화된 상태이므로 저장 효율성이 떨어질 수 있습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음