AmazonAmazon Data Engineer Associate DEA-C01 Certification·KO·업데이트됨 2 Aug 2026
한 게임 회사가 Amazon Kinesis Data Streams를 사용하여 클릭스트림 이벤트를 수집하고 Kinesis Data Firehose를 사용하여 JSON 파일을 Amazon S3로 전송합니다. 데이터 과학자들은 Amazon Athena에서 최신 데이터를 쿼리합니다. 이 회사는 기존 데이터 파이프라인을 재구축하지 않고 Athena 쿼리 비용을 절감하고자 합니다. 요구 사항을 충족하면서 관리 노력을 최소화하는 옵션은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: Firehose가 Apache Parquet을 출력하도록 구성하고, YYYYMMDD와 같은 사용자 지정 S3 객체 접두사와 큰 버퍼 크기를 설정합니다. 과거 데이터의 경우 AWS Glue ETL 작업을 실행하여 작은 JSON 파일을 YYYYMMDD 접두사가 있는 더 큰 Parquet 파일로 통합한 다음, ALTER TABLE ADD PARTITION을 실행하여 기존 Athena 테이블을 업데이트합니다..
이것이 정답인 이유
이 옵션은 Firehose가 Parquet 형식으로 직접 출력하고 S3 접두사(파티션)를 사용하여 Athena 쿼리 성능을 최적화함으로써 Athena 쿼리 비용을 절감합니다. Parquet은 열 형식 저장소로, Athena가 필요한 열만 읽을 수 있게 하여 스캔하는 데이터 양을 줄입니다. 큰 버퍼 크기는 S3에 더 큰 파일을 생성하여 Athena의 파일 처리 오버헤드를 줄입니다. 기존 데이터에 대해 Glue ETL을 사용하여 작은 JSON 파일을 Parquet으로 통합하고 파티션을 추가하는 것은 과거 데이터에 대한 쿼리 효율성도 향상시킵니다. 이 접근 방식은 관리 노력을 최소화하면서 비용 절감 및 성능 향상을 제공합니다.
다른 옵션들은 다음과 같은 이유로 최적이 아닙니다.
Spark 작업은 EMR 클러스터 관리 및 비용이 추가됩니다.
Kinesis Data Stream과 Apache Flink를 사용하는 것은 파이프라인을 재구축하는 것에 가까우며 관리 복잡성이 증가합니다.
Lambda를 사용하는 것은 대량의 데이터 처리 시 확장성 및 비용 문제가 발생할 수 있습니다.