애플리케이션이 매시간 수백 개의 1GB .csv 파일을 Amazon S3 버킷에 저장합니다. 업로드된 각 파일은 Apache Parquet 형식으로 변환되어 S3 버킷에 기록되어야 합니다. 운영 오버헤드가 가장 적으면서 필요한 기능을 제공하는 솔루션은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: .csv 파일을 Parquet으로 변환하고 출력 파일을 S3 버킷에 기록하는 AWS Glue ETL(추출, 변환, 로드) 작업을 생성합니다. 각 S3 PUT 이벤트에 대해 ETL 작업을 호출하는 AWS Lambda 함수를 생성합니다..
이것이 정답인 이유
정답은 AWS Glue ETL 작업을 사용하여 .csv 파일을 Parquet으로 변환하고, S3 PUT 이벤트에 의해 트리거되는 Lambda 함수로 이 Glue 작업을 호출하는 것입니다. AWS Glue는 서버리스 ETL 서비스로, 대규모 데이터 변환에 최적화되어 있으며 운영 오버헤드가 가장 적습니다. Glue 작업은 수백 개의 1GB 파일과 같은 대용량 데이터를 효율적으로 처리할 수 있습니다.
오답 설명:
Lambda 함수만 사용하는 옵션은 각 파일이 1GB로 크기 때문에 Lambda의 실행 시간 및 메모리 제한에 부딪힐 수 있습니다.
Apache Spark 작업을 Lambda로 호출하는 옵션은 Spark 클러스터 관리로 인해 운영 오버헤드가 더 커집니다.
AWS Glue 테이블과 Athena를 사용하는 옵션은 주기적인 쿼리를 통해 변환을 수행하므로 실시간에 가까운 변환 요구사항을 충족하기 어렵고, Athena는 주로 쿼리 서비스이지 ETL 서비스가 아닙니다.