한 회사에서 SAP HANA, SQL Server, MongoDB, Kafka, DynamoDB와 같은 소스에서 매일 약 1TB의 데이터를 추출합니다. 일부 소스에는 정의되지 않거나 진화하는 스키마가 있습니다. 솔루션은 스키마를 감지하고 ETL을 수행하며 데이터 생성 후 15분 이내에 데이터를 S3에 로드해야 합니다. 운영 오버헤드가 가장 적으면서 필요한 기능을 제공하는 접근 방식은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: AWS Glue를 사용하여 스키마를 감지하고 데이터를 추출, 변환 및 S3 버킷에 로드합니다. Apache Spark에서 파이프라인을 생성합니다..
이것이 정답인 이유
AWS Glue는 서버리스 ETL 서비스로, 다양한 소스에서 스키마를 자동으로 감지하고, 데이터를 변환하며, S3에 로드하는 데 최적화되어 있습니다. 특히 정의되지 않거나 진화하는 스키마를 가진 데이터에 대한 스키마 추론 기능이 강력합니다. Apache Spark 기반의 ETL 파이프라인을 생성하여 대량의 데이터를 효율적으로 처리할 수 있으며, 완전 관리형 서비스이므로 운영 오버헤드가 가장 적습니다. Amazon EMR은 Spark를 사용할 수 있지만, Glue만큼 스키마 감지 및 관리 기능이 내장되어 있지 않으며, 클러스터 관리 오버헤드가 더 큽니다. AWS Lambda는 대규모 데이터 ETL 작업에 적합하지 않으며, 실행 시간 및 메모리 제약이 있습니다. Amazon Redshift는 데이터 웨어하우스이며, 원본 데이터 추출 및 스키마 감지 기능이 주 목적이 아닙니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음