데이터 과학자가 Amazon S3 데이터 레이크에 CSV 파일로 저장된 약 500GB의 과거 재고 데이터를 탐색해야 합니다. 데이터 과학자는 탐색을 위해 SQL을 사용하기를 원하며, 회사는 비용과 운영 오버헤드를 최소화하기를 원합니다. 최소한의 운영 관리로 이러한 요구 사항을 충족하는 접근 방식은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: AWS Glue를 사용하여 S3 버킷을 크롤링하고 AWS Glue Data Catalog를 채운 다음, Amazon Athena로 데이터를 쿼리합니다..
이것이 정답인 이유
정답은 AWS Glue를 사용하여 S3 버킷을 크롤링하고 AWS Glue Data Catalog를 채운 다음, Amazon Athena로 데이터를 쿼리하는 것입니다. 이 접근 방식은 서버리스이며, 데이터 과학자가 SQL을 사용하여 S3의 데이터를 직접 쿼리할 수 있도록 하여 운영 오버헤드와 비용을 최소화합니다. AWS Glue 크롤러는 데이터 스키마를 자동으로 감지하고 AWS Glue Data Catalog에 메타데이터를 저장하며, Athena는 이 카탈로그를 사용하여 S3 데이터를 쿼리합니다. Amazon EMR은 관리형 Hadoop 프레임워크를 제공하지만, 클러스터를 프로비저닝하고 관리해야 하므로 운영 오버헤드가 더 큽니다. Amazon Redshift는 데이터 웨어하우스 솔루션으로, 데이터를 로드하고 클러스터를 관리해야 하므로 비용과 운영 오버헤드가 더 높습니다. 외부 테이블을 사용하더라도 Redshift 클러스터 자체의 관리가 필요합니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음