고객 데이터는 매일 압축된 날짜별 파티션 파일로 S3에 저장됩니다. 분석가는 매월 데이터를 다운로드하고 유효성을 검사하며 결과를 QuickSight에 업로드합니다. 엔지니어는 QuickSight로 보내기 전에 가장 적은 운영 오버헤드로 데이터 품질을 자동으로 확인해야 합니다. 어떤 솔루션이 가장 적합할까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 매월 AWS Glue crawler를 실행하여 AWS Glue Data Catalog를 업데이트합니다. AWS Glue Data Quality 규칙을 사용하여 데이터 품질을 확인합니다..
이것이 정답인 이유
이 솔루션은 AWS Glue Data Quality(GDQ)를 활용하여 데이터 품질 검사를 자동화하고 운영 오버헤드를 최소화합니다. GDQ는 AWS Glue Data Catalog와 직접 통합되어 데이터 품질 규칙을 정의하고 실행할 수 있습니다. 매월 AWS Glue crawler를 실행하여 Data Catalog를 최신 상태로 유지하고, GDQ 규칙을 적용하여 데이터 품질을 자동으로 확인할 수 있습니다. 다른 옵션들은 다음과 같은 이유로 적합하지 않습니다. AWS Glue job과 PySpark를 사용하는 것은 사용자 지정 코드를 작성해야 하므로 운영 오버헤드가 더 큽니다. AWS Lambda 함수를 사용하는 것은 매월 수동으로 실행해야 하거나, S3 객체 추가 시 트리거되도록 설정하면 매일 실행되어 불필요한 비용이 발생할 수 있습니다. Amazon SQS와 CloudWatch Insights를 사용하는 것은 SQS가 메시지 대기열 서비스이므로 데이터 품질 평가에 직접적으로 적합하지 않습니다. CloudWatch Insights는 로그 분석 도구로, 데이터 자체의 품질을 평가하기보다는 서비스 지표 분석에 더 적합합니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음