데이터 엔지니어는 구조화된 .csv 파일(15개 열)을 Amazon S3 데이터 레이크로 로드해야 합니다. 분석가는 일반적으로 한두 개의 열만 참조하고 전체 파일을 거의 스캔하지 않는 Amazon Athena 쿼리를 실행합니다. 가장 비용 효율적인 접근 방식은 무엇입요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: AWS Glue ETL(추출, 변환, 로드) 작업을 생성하여 .csv 구조화된 데이터 원본에서 읽습니다. Apache Parquet 형식으로 데이터를 데이터 레이크에 쓰도록 작업을 구성합니다..
이것이 정답인 이유
가장 비용 효율적인 접근 방식은 AWS Glue ETL 작업을 사용하여 원본 CSV 데이터를 읽고 Apache Parquet 형식으로 데이터 레이크에 쓰는 것입니다. Parquet은 열 기반 스토리지 형식으로, 분석가가 한두 개의 열만 쿼리할 때 필요한 데이터만 읽으므로 Athena 쿼리 비용을 크게 절감합니다. 또한 Parquet은 압축 및 인코딩 효율성이 뛰어나 스토리지 비용도 줄여줍니다. CSV 형식으로 수집하는 것은 열 기반 쿼리에 비효율적이며, 전체 파일을 스캔해야 하므로 비용이 증가합니다. JSON 형식은 반정형 데이터에 적합하지만, 구조화된 데이터에는 Parquet만큼 효율적이지 않으며, 열 기반 쿼리 성능이 떨어집니다. Apache Avro는 행 기반 형식으로, Parquet과 같은 열 기반 쿼리 최적화를 제공하지 않습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음