AmazonAmazon Data Engineer Associate DEA-C01 Certification·KO·업데이트됨 2 Aug 2026
한 회사에서 필드 이름과 형식이 일치하지 않는(예: 한 데이터베이스에서는 place_id, 다른 데이터베이스에서는 location_id) 여러 Amazon RDS 고객 데이터베이스에서 데이터를 읽습니다. 필드 이름이 다르더라도 데이터베이스 간에 고객 레코드를 연결해야 합니다. 운영 오버헤드가 가장 적은 솔루션은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: AWS Glue 크롤러를 생성하여 데이터베이스를 크롤링합니다. FindMatches 변환을 사용하여 데이터에서 중복 레코드를 찾습니다. 성능 및 결과를 검토하여 변환을 평가하고 튜닝합니다..
이것이 정답인 이유
이 솔루션은 운영 오버헤드를 최소화하면서 데이터 불일치 문제를 해결합니다. AWS Glue 크롤러는 다양한 RDS 데이터베이스의 스키마를 자동으로 검색하고 AWS Glue 데이터 카탈로그에 메타데이터를 저장하여 필드 이름 불일치를 추상화합니다. AWS Glue의 FindMatches 변환은 기계 학습을 사용하여 필드 이름이 다르더라도 유사한 고객 레코드를 식별하고 연결합니다. 이는 복잡한 수동 코딩이나 인프라 관리가 필요 없어 운영 오버헤드가 가장 적습니다.
다른 옵션들은 다음과 같은 이유로 최적이 아닙니다.
프로비저닝된 Amazon EMR 클러스터는 관리 오버헤드가 더 크고, FindMatches 변환은 AWS Glue에서 직접 제공됩니다.
Amazon SageMaker와 Apache Spark ML 파이프라인을 사용하는 것은 더 많은 개발 및 관리 노력이 필요하며, AWS Glue의 내장 기능을 사용하는 것보다 복잡합니다.