한 회사에서 매일 같은 시간에 AWS Glue ETL 작업을 실행하여 Amazon S3 버킷에 저장된 XML 데이터를 처리합니다. 새 데이터는 매일 S3 버킷에 추가됩니다. 솔루션스 아키텍트는 AWS Glue가 실행할 때마다 모든 데이터를 다시 처리하는 것을 발견했습니다. 솔루션스 아키텍트는 AWS Glue가 이전 데이터를 다시 처리하지 않도록 어떻게 해야 할까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 작업을 편집하여 job bookmarks를 사용합니다..
이것이 정답인 이유
AWS Glue job bookmarks는 이전에 처리된 데이터를 추적하여 후속 실행 시 새 데이터만 처리되도록 합니다. 이는 S3에 새 데이터가 매일 추가되는 시나리오에서 재처리를 방지하는 데 필수적입니다. 데이터를 처리한 후 삭제하는 것은 데이터 보존 요구 사항을 위반할 수 있으며, 이전에 처리된 데이터를 다시 처리하지 않는다는 보장이 없습니다. NumberOfWorkers 필드를 1로 설정하는 것은 작업의 병렬 처리 수준을 제어하지만, 데이터 재처리를 방지하지는 않습니다. FindMatches ML 변환은 데이터 레코드 간의 중복을 식별하는 데 사용되며, 데이터 재처리를 방지하는 기능과는 관련이 없습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음