한 회사에서 매일 약 2GB 크기의 고객 데이터가 포함된 .xls 파일을 S3로 수신합니다. 데이터 엔지니어는 first-name 및 last-name 열을 연결하고 파일에 있는 고유 고객 수를 세어야 합니다. 어떤 접근 방식이 운영 노력이 가장 적게 필요할까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: AWS Glue DataBrew를 사용하여 COUNT_DISTINCT 집계 함수를 사용하는 레시피를 생성하여 고유 고객 수를 계산합니다..
이것이 정답인 이유
AWS Glue DataBrew는 코드가 필요 없는 시각적 데이터 준비 도구로, 데이터 변환 및 정리 작업을 쉽게 수행할 수 있습니다. 주어진 시나리오에서 고객 데이터의 first-name과 last-name을 연결하고 고유 고객 수를 세는 작업은 DataBrew의 내장된 변환 및 COUNTDISTINCT 집계 함수를 사용하여 운영 노력을 최소화하면서 효율적으로 처리할 수 있습니다. 이는 코드를 작성하거나 Spark 환경을 관리할 필요가 없어 가장 적은 운영 노력을 요구합니다. AWS Glue 노트북에서 Spark 작업을 생성하는 것은 코드를 작성해야 하므로 운영 노력이 더 필요합니다. AWS Glue 크롤러와 Amazon Athena는 SQL 쿼리를 실행해야 하며, 이는 DataBrew만큼 시각적이고 직관적이지 않습니다. Amazon EMR Serverless는 Spark 작업을 실행하지만, 여전히 코드 개발과 Spark 환경 관리가 필요하여 DataBrew보다 운영 노력이 많습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음