한 회사에서 여러 소스의 데이터를 S3 버킷으로 수집하고, AWS Glue ETL 작업을 실행하여 데이터를 변환한 다음, 변환된 출력을 Amazon Athena에서 쿼리하는 S3 기반 데이터 레이크에 저장합니다. 이 회사는 공유되는 고유 식별자가 없는 경우에도 일치하는 레코드를 식별해야 합니다. 이 작업을 수행할 솔루션은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: ETL 작업에서 AWS Lake Formation FindMatches 변환을 훈련하고 사용합니다..
이것이 정답인 이유
정답은 AWS Lake Formation FindMatches 변환을 훈련하고 사용하는 것입니다. FindMatches는 고유 식별자가 없는 경우에도 기계 학습을 사용하여 일치하는 레코드를 식별하고 중복을 제거하도록 설계되었습니다. 이는 데이터 레이크에서 데이터 품질을 향상시키는 데 매우 효과적입니다. 오답인 Amazon Macie 패턴 매칭은 주로 민감한 데이터를 식별하는 데 사용되며, 레코드 일치에는 적합하지 않습니다. AWS Glue PySpark Filter 클래스는 특정 조건에 따라 데이터를 필터링하는 데 사용되지만, 고유 식별자 없이 복잡한 레코드 일치를 수행할 수는 없습니다. 테이블을 파티셔닝하는 것은 쿼리 성능을 향상시키지만, 레코드 일치 문제를 해결하지는 않습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음