한 데이터 과학자가 Amazon S3에 20TB의 CSV 데이터를 가지고 있으며, 이를 최소한의 노력으로 Apache Parquet 형식으로 변환해야 합니다. 이 변환을 수행하는 가장 간단한 방법은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 변환 스크립트를 작성하고 AWS Glue 작업으로 실행하여 CSV를 읽고 Parquet 출력을 작성합니다..
이것이 정답인 이유
가장 간단하고 효율적인 방법은 AWS Glue 작업을 사용하는 것입니다. AWS Glue는 서버리스 ETL(추출, 변환, 로드) 서비스로, 대규모 데이터 변환에 최적화되어 있습니다. 데이터 과학자는 CSV 파일을 읽고 Parquet 형식으로 쓰는 Python 또는 Scala 스크립트를 작성하여 Glue 작업으로 실행할 수 있습니다. Glue는 필요한 컴퓨팅 리소스를 자동으로 프로비저닝하고 관리하므로 인프라 설정에 대한 노력이 최소화됩니다. AWS Glue 크롤러는 스키마를 감지하고 Glue Data Catalog에 메타데이터를 추가하지만, 파일 형식을 직접 변환하지는 않습니다. Amazon EMR은 강력한 빅 데이터 처리 플랫폼이지만, 클러스터 설정 및 관리가 필요하여 "최소한의 노력"이라는 조건에 부합하지 않습니다. Amazon SageMaker 노트북은 데이터 탐색 및 모델 개발에 적합하지만, 20TB와 같은 대규모 데이터 변환 작업에는 적합하지 않으며, 노트북 인스턴스의 제한된 리소스와 장기 실행 작업 관리의 어려움이 있습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음