한 회사에서 CSV 파일을 Amazon S3 버킷에 업로드합니다. AWS Glue 크롤러는 데이터에 대한 테이블과 스키마를 구축하고, AWS Glue 작업은 테이블을 처리하고 결과를 Amazon Redshift 데이터베이스에 기록합니다. Glue 작업은 열 매핑을 처리하고 필요에 따라 Redshift 테이블을 생성합니다. Glue 작업을 다시 실행하면 Redshift 테이블에 중복 행이 나타납니다. 회사는 중복을 발생시키지 않고 Redshift 테이블을 업데이트하는 방법이 필요합니다. 어떤 접근 방식이 이 요구 사항을 충족합니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: AWS Glue 작업을 수정하여 행을 스테이징 Redshift 테이블로 복사합니다. 스테이징 Redshift 테이블의 새 값으로 기존 행을 업데이트하는 SQL 명령을 추가합니다..
이것이 정답인 이유
이 접근 방식은 Redshift에서 중복을 방지하는 일반적인 방법입니다. Glue 작업은 먼저 새 데이터를 임시(스테이징) 테이블에 로드합니다. 그런 다음 SQL MERGE 또는 UPSERT 명령(또는 DELETE 후 INSERT)을 사용하여 스테이징 테이블의 데이터를 기반으로 실제 대상 Redshift 테이블의 기존 행을 업데이트하거나 새 행을 삽입합니다. 이렇게 하면 중복 없이 데이터가 동기화됩니다. MySQL 데이터베이스를 사용하는 것은 불필요한 복잡성과 비용을 추가합니다. dropDuplicates() API는 현재 Glue 작업 실행 내의 중복만 처리하며, 이전 실행에서 이미 Redshift에 있는 중복을 제거하지 못합니다. ResolveChoice는 데이터 유형 불일치를 해결하는 데 사용되며 중복 제거와는 관련이 없습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음