ML 훈련에 사용할 CSV 데이터셋을 S3에서 받았습니다. 훈련 전에 누락되거나 유효하지 않은 값을 찾고, 최소한의 운영 노력으로 이상치를 세어야 합니다. 어떤 접근 방식이 이 요구 사항을 충족합까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 데이터를 CSV로 유지하고, SageMaker Data Wrangler로 가져온 다음, Data Quality and Insights 보고서를 사용합니다..
이것이 정답인 이유
SageMaker Data Wrangler는 데이터 준비 및 특성 엔지니어링을 위한 시각적 인터페이스를 제공하며, Data Quality and Insights 보고서는 누락된 값, 유효하지 않은 값, 이상치 등을 자동으로 감지하고 시각화하여 최소한의 노력으로 데이터 품질을 평가할 수 있게 합니다. CSV 형식은 Data Wrangler에서 직접 처리할 수 있으므로 변환할 필요가 없습니다.
다른 옵션들은 다음과 같은 이유로 적합하지 않습니다.
AWS Glue와 Athena는 SQL 쿼리를 통해 통계를 얻을 수 있지만, 이상치 감지 및 시각화와 같은 복잡한 데이터 품질 분석에는 추가적인 SQL 스크립트 작성 및 분석 노력이 필요합니다.
CSV를 Parquet으로 변환하는 것은 데이터 저장 및 쿼리 성능에는 이점이 있지만, 질문에서 요구하는 데이터 품질 분석 및 이상치 감지에는 직접적인