데이터 엔지니어가 .csv 및 .json 파일이 모두 포함된 S3 버킷의 데이터를 카탈로그화하도록 AWS Glue 크롤러를 구성했습니다. 크롤러는 .json 파일을 제외하도록 설정되었지만, Athena 쿼리를 실행할 때 .json 파일이 여전히 처리되고 있습니다. 엔지니어는 .csv 파일에 대한 액세스를 변경하지 않고 이 문제를 해결해야 하며, 쿼리 시간을 최대한 단축하고자 합니다. 가장 좋은 해결책은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: .json 파일을 S3 버킷 내의 다른 경로로 옮깁니다..
이것이 정답인 이유
정답은 .json 파일을 S3 버킷 내의 다른 경로로 옮기는 것입니다. AWS Glue 크롤러는 S3 접두사(경로)를 기반으로 데이터를 스캔합니다. 크롤러 설정에서 .json 파일을 제외하도록 구성했더라도, 해당 파일들이 크롤러가 스캔하는 경로 내에 존재하면 크롤러는 메타데이터를 생성할 수 있습니다. .json 파일을 크롤러가 스캔하지 않는 다른 S3 경로로 옮기면, 크롤러는 해당 파일을 더 이상 발견하지 못하고 Athena 쿼리에서도 처리되지 않습니다. 이는 .csv 파일에 대한 액세스에 영향을 주지 않으면서 쿼리 시간을 단축하는 가장 효율적인 방법입니다. 다른 옵션들은 다음과 같은 이유로 최적의 해결책이 아닙니다. AWS Glue 크롤러 설정에서 .json 파일 제외를 조정하는 것은 이미 시도되었거나, 크롤러가 스캔하는 경로 내에 파일이 있다면 여전히 문제가 발생할 수 있습니다. Athena 콘솔에서 .json 파일을 제외하도록 하는 것은 매번 쿼리를 실행할 때마다 수동으로 제외 조건을 추가해야 하므로 효율적이지 않습니다. S3 버킷 정책을 사용하여 .json 파일에 대한 액세스를 차단하는 것은 데이터 접근 자체를 막는 것이므로, 향후 .json 파일에 대한 접근이 필요할 경우 문제가 될 수 있습니다. 또한, 이미 카탈로그화된 메타데이터를 제거하지는 않습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음