한 회사에서 Amazon S3 버킷에 저장된 CSV 파일의 양이 크게 증가했습니다. 데이터 변환 스크립트와 쿼리가 훨씬 느려졌습니다. ML 엔지니어는 운영 오버헤드를 최소화하면서 쿼리 성능에 최적화된 솔루션을 구현해야 합니다. 다음 중 이 요구 사항을 충족하는 옵션은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: AWS Glue ETL(추출, 변환, 로드) 작업을 구성하여 .csv 파일을 Apache Parquet 형식으로 변환합니다..
이것이 정답인 이유
정답은 AWS Glue ETL 작업을 구성하여 .csv 파일을 Apache Parquet 형식으로 변환하는 것입니다. Parquet은 열 형식 저장소로, 쿼리 성능을 크게 향상시키고 스토리지 비용을 절감합니다. AWS Glue는 서버리스 ETL 서비스로, 운영 오버헤드를 최소화하면서 데이터 변환을 자동화합니다. 오답 설명: AWS Lambda 함수로 CSV 파일을 더 작은 객체로 분할하는 것은 쿼리 성능을 약간 개선할 수 있지만, Parquet 변환만큼 효율적이지 않으며, 여전히 행 형식 데이터를 처리해야 합니다. AWS Glue 작업을 구성하여 string 타입 값을 가진 열을 삭제하는 것은 데이터 크기를 줄일 수 있지만, 쿼리 성능 최적화에 있어 Parquet 변환만큼 효과적이지 않습니다. 또한, 중요한 정보가 포함된 열을 삭제하는 것은 데이터 분석에 부정적인 영향을 줄 수 있습니다. Amazon EMR 클러스터를 구성하는 것은 대규모 데이터 처리에 강력하지만, 클러스터 관리 및 운영 오버헤드가 발생하여 문제에서 요구하는 '운영 오버헤드 최소화'에 부합하지 않습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음