서로 다른 구조와 형식을 가진 두 데이터 세트(고객 주문 및 제품 카탈로그 설명)를 병합하고, 유사한 레코드를 일치시키고 중복을 제거해야 합니다. 이 데이터를 일치시키고 정제하는 데 가장 적합한 솔루션은 무엇입요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: AWS Glue 크롤러를 실행하여 Glue Data Catalog를 채우고 Glue FindMatches 변환을 사용하여 유사한 레코드를 식별하고 데이터를 중복 제거합니다..
이것이 정답인 이유
AWS Glue의 FindMatches 변환은 서로 다른 구조와 형식의 데이터 세트에서 유사한 레코드를 식별하고 중복을 제거하는 데 특화된 기계 학습 변환입니다. 이는 정확한 일치가 아닌 '유사 일치'를 처리하므로, 고객 주문과 제품 카탈로그 설명처럼 구조가 다른 데이터를 병합하고 정제하는 데 가장 적합합니다. AWS Glue 크롤러는 데이터 스키마를 자동으로 검색하여 Glue Data Catalog를 채우는 데 필수적입니다. 다른 옵션들은 이러한 복잡한 유사성 기반 매칭 및 중복 제거 기능을 제공하지 않습니다. AWS Lambda는 프로그래밍 방식의 복잡성과 유지 관리 부담이 크며, Glue SearchTables API는 유사 일치보다는 메타데이터 검색에 중점을 둡니다. Lake Formation은 데이터 보안 및 거버넌스 도구이지, 데이터 매칭 및 변환 도구가 아닙니다.