한 회사에서 S3에 중첩된 JSON 파일로 훈련 데이터를 저장하고 있으며, XGBoost 훈련을 위해 테이블 형식의 데이터가 필요합니다. 이 JSON 파일들을 테이블 형식 데이터로 변환하는 데 운영 오버헤드가 가장 적은 접근 방식은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: Relationalize 변환을 사용하여 파일을 변환하는 AWS Glue PySpark 작업을 생성합니다..
이것이 정답인 이유
정답은 AWS Glue PySpark 작업을 생성하여 Relationalize 변환을 사용하는 것입니다. AWS Glue의 Relationalize 변환은 중첩된 JSON 데이터를 평면화하여 테이블 형식으로 변환하는 데 최적화되어 있습니다. 이는 운영 오버헤드가 가장 적은 방법입니다. AWS Glue는 서버리스 ETL 서비스이므로 인프라 관리가 필요 없으며, PySpark를 사용하여 대규모 데이터 처리도 효율적으로 수행할 수 있습니다. 사용자 지정 Scala 코드를 작성하고 Amazon EMR Serverless로 실행하는 것은 유연하지만, Relationalize 변환만큼 특정 작업에 최적화되어 있지 않으며, 코드 개발 및 유지보수 비용이 더 들 수 있습니다. AWS Lambda 함수는 대규모 데이터 처리에는 적합하지 않으며, reduce() 함수만으로는 복잡한 중첩 JSON을 효율적으로 평면화하기 어렵습니다. Amazon Athena는 JSON 파일 위에 데이터베이스를 생성하고 쿼리할 수 있지만, flatten 함수는 중첩된 배열을 처리하는 데 주로 사용되며, 복잡한 중첩 JSON 객체를 완전히 테이블 형식으로 변환하는 데는 한계가 있고, 데이터 변환 자체를 위한 ETL 도구라기보다는 쿼리 도구에 가깝습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음