10GB Amazon DynamoDB 테이블에 IoT 토양 센서 데이터가 있고, Amazon S3에 5GB JSON 파일 형식으로 기상 이벤트 데이터가 있습니다. 이 결합된 데이터 세트를 Amazon SageMaker 모델 학습에 사용할 수 있도록 최소한의 관리 오버헤드로 준비하려고 합니다. 필요한 변환을 가장 잘 수행하는 접근 방식은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: AWS Glue 크롤러를 실행하여 데이터를 카탈로그화합니다. DynamoDB 및 S3 데이터 세트를 병합하고 병합된 출력을 CSV 파일로 Amazon S3에 쓰는 AWS Glue ETL 작업을 생성합니다..
이것이 정답인 이유
정답은 AWS Glue 크롤러를 실행하여 데이터를 카탈로그화하고, DynamoDB 및 S3 데이터 세트를 병합하며, 병합된 출력을 CSV 파일로 Amazon S3에 쓰는 AWS Glue ETL 작업을 생성하는 것입니다. AWS Glue는 서버리스 ETL 서비스로, 최소한의 관리 오버헤드로 다양한 데이터 소스에서 데이터를 추출, 변환, 로드(ETL)하는 데 매우 적합합니다. 크롤러는 데이터 스키마를 자동으로 감지하여 AWS Glue 데이터 카탈로그에 저장하며, ETL 작업은 Python 또는 Scala로 작성되어 데이터 통합 및 변환을 수행합니다. 최종적으로 SageMaker 학습에 적합한 CSV 형식으로 S3에 저장하는 것이 효율적입니다. 오답: Amazon EMR은 대규모 데이터 처리에 강력하지만, 클러스터 관리 오버헤드가 발생하며, 여기서는 AWS Glue가 더 적합합니다. AWS Glue ETL 작업을 Amazon Redshift에 쓰는 것은 가능하지만, SageMaker 학습 데이터는 일반적으로 S3에 저장하는 것이 더 효율적이며, Redshift 클러스터 관리 오버헤드가 추가됩니다. DynamoDB Streams와 Lambda를 사용하여 S3 파일에 스트림 항목을 추가하는 것은 실시간 데이터 처리에 적합하지만, 기존 S3 파일과 DynamoDB 데이터를 통합하여 SageMaker 학습용으로 준비하는 데는 적합하지 않습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음