한 회사에서 매일 ETL 파이프라인을 실행합니다. 이 파이프라인은 대규모 EC2 인스턴스에서 Python 스크립트로 구현되어 S3에 저장된 수 테라바이트의 사용자 상호 작용 데이터를 정리, 변환, 보강 및 압축합니다. 이 프로세스는 20시간 이상 소요되며, 회사는 최소한의 개발 노력으로 EC2에서 관리형 서버리스 솔루션으로 전환하고자 합니다. 다음 접근 방식 중 이러한 요구 사항을 충족하는 것은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: AWS Glue 작업을 생성하고, 스크립트를 PySpark로 변환하고, Glue 작업을 실행하여 데이터를 처리하고, 결과를 S3에 저장합니다..
이것이 정답인 이유
정답은 AWS Glue 작업을 생성하고, 스크립트를 PySpark로 변환하고, Glue 작업을 실행하여 데이터를 처리하고, 결과를 S3에 저장하는 것입니다. AWS Glue는 서버리스 ETL 서비스로, 대규모 데이터 처리 워크로드를 관리형 방식으로 실행하는 데 적합합니다. 기존 Python 스크립트를 PySpark로 변환하는 것은 최소한의 개발 노력으로 가능하며, Glue는 테라바이트 규모의 데이터를 효율적으로 처리할 수 있습니다. Amazon Redshift는 데이터 웨어하우스 솔루션이지만, ETL 파이프라인을 SQL로 완전히 재작성하는 것은 상당한 개발 노력이 필요합니다. Amazon DynamoDB는 NoSQL 데이터베이스로, 테라바이트 규모의 사용자 상호 작용 데이터에 대한 복잡한 ETL 작업에는 적합하지 않습니다. AWS Lambda는 서버리스 함수이지만, 20시간 이상 걸리는 테라바이트 규모의 데이터 처리에는 적합하지 않으며, Lambda의 실행 시간 제한과 메모리 제한을 초과할 가능성이 높습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음