페타바이트 규모의 데이터 세트에 대해 클러스터 인프라를 관리하지 않고, 실행하는 쿼리에 대해서만 비용을 지불하며, Jupyter 노트북에서 Python으로 분석을 작성하는 탐색적 데이터 분석(EDA)을 수행해야 합니다. 어떤 솔루션이 이러한 제약 조건을 충족합니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: Amazon Athena 내에서 Apache Spark를 실행합니다..
이것이 정답인 이유
정답은 "Amazon Athena 내에서 Apache Spark를 실행합니다"입니다. Amazon Athena는 서버리스 쿼리 서비스로, 페타바이트 규모의 데이터를 관리할 필요 없이 쿼리에 대해서만 비용을 지불합니다. 최근 Athena는 Apache Spark를 지원하여 Jupyter Notebook 환경에서 Python으로 데이터 분석을 수행할 수 있게 되었습니다. "Amazon SageMaker 내에서 Apache Spark를 실행합니다"는 SageMaker Studio 노트북에서 Spark를 사용할 수 있지만, Athena처럼 쿼리 기반 비용 모델이 아니며, 데이터 레이크 쿼리에 최적화된 서버리스 솔루션은 아닙니다. "프로비저닝하는 Amazon EMR 클러스터에서 Apache Spark를 실행합니다"는 클러스터 인프라를 직접 관리해야 하므로 요구 사항에 부합하지 않습니다. "Amazon Redshift와 통합된 Apache Spark를 사용합니다"는 Redshift 클러스터를 관리해야 하며, Redshift는 주로 데이터 웨어하우징에 사용되며 데이터 레이크의 원시 파일 쿼리에는 Athena가 더 적합합니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음