Amazon MLS-C01: 탐색적 데이터 분석 및 시각화 — 학습 가이드

다음의 일부입니다: AWS Machine Learning Specialty MLS-C01 — 학습 가이드. 검증된 답안으로 연습하기: Amazon 시험 허브, 또는 다음에서 시간 제한 모의고사 풀기: ExamRoll.io.

분포, 변환, 피처 스케일링

원시 피처 분포를 이해하는 것은 EDA(탐색적 데이터 분석)의 기초입니다. SageMaker Studio 노트북 또는 SageMaker Processing 작업(scikit-learn/pandas가 포함된 ml.m5.xlarge)에서 각 변수를 히스토그램, 커널 밀도 추정, 분위수 요약으로 프로파일링하는 것부터 시작하십시오. 로그 변환, Box-Cox, Yeo-Johnson, 순위 기반 변환(quantile transformer)은 오른쪽으로 치우친 데이터에 적합합니다. 하지만 Box-Cox는 양수 값만 허용하며 0에서는 실패합니다. 흔한 함정으로는 0을 오프셋하지 않고 로그/Box-Cox를 적용하거나, 모델 결과 해석 시 변환을 역으로 되돌리는 것을 잊는 경우가 있습니다. 표준화(평균 0, 단위 분산)는 거리 기반 방법(k-means, PCA, SVM)과 정규화된 선형 모델 이전에 필수적이며, 최소-최대 스케일링은 경계가 있는 활성화 함수를 가진 신경망에 유용합니다. 배포 시에는 온라인 및 배치 추론이 동일한 전처리 과정을 사용하도록 SageMaker Feature Store나 모델 아티팩트에 변환기를 저장(persist)해야 합니다. 매우 큰 S3 데이터셋을 프로파일링하고 요약 통계를 생성하려면 AWS Glue 또는 Glue DataBrew를 사용하고, 계층화된 샘플을 쿼리하려면 Athena를 사용하십시오. 의사결정 기준은 알고리즘의 민감도에 따라 달라집니다. 트리 앙상블은 스케일링되지 않은 피처를 허용하지만, 선형 및 거리 기반 방법은 그렇지 않습니다. 마지막으로, 강건한 통계(중앙값, IQR)를 사용하여 이상치와 두꺼운 꼬리(heavy tail)를 확인하고, 무작정 데이터를 제거하기보다는 클리핑, 윈저화 또는 별도 모델링(세분화) 여부를 검토하십시오.

잔차 분석, 학습 곡선, 진단 테스트

잔차는 모델의 잘못된 설정(0이 아닌 평균, 이분산성, 자기상관 또는 비선형성)을 드러내므로 반드시 진단해야 합니다. SageMaker Studio에서 예측값 대비 잔차 및 주요 피처 대비 잔차 플롯을 그리고, 자기상관을 위해 Durbin-Watson을 계산하고, 시계열 잔차 상관관계를 위해 Ljung-Box를 사용하십시오. 회귀 분석의 경우, 이분산성을 나타내는 깔때기 모양을 찾으십시오. 이 경우 분산 안정화 변환을 적용하거나 이분산성 모델(예: 목적 함수를 조정한 XGBoost 또는 확률적 예측)을 사용합니다. 학습 곡선(훈련 세트 크기에 따른 훈련 및 검증 오류 플롯)은 높은 분산(과적합) 또는 높은 편향(과소적합)을 식별합니다. SageMaker Debugger를 사용하여 에포크별 텐서와 CloudWatch 지표를 캡처하고, 훈련 손실은 감소하는데 검증 손실이 발산하는 경우 트리거될 CloudWatch 경보를 추가하십시오. 흔한 함정으로는 시계열 데이터에 무작위 교차 검증을 사용하거나(시간 기반 분할 사용), 불균형 데이터셋에서 정확도로 평가하는 것(정밀도-재현율 또는 AUC-PR 선호)이 있습니다. 하이퍼파라미터 튜닝 시에는 이러한 진단 결과를 바탕으로 결정을 내리십시오. 검증 격차가 지속되면 정규화를 늘리거나, 데이터를 추가하거나, 모델 복잡도를 줄이십시오. 두 오류 모두 높으면 모델 용량(capacity)을 늘리거나 피처를 추가하십시오. 재현성을 위해 SageMaker Experiments를 통해 진단 플롯과 지표를 저장하십시오.

차원 축소, PCA, 고유값 분석, 클러스터링

차원 축소는 노이즈를 줄이고 해석 가능성을 향상시킵니다. 스케일링 후 PCA 또는 무작위 SVD(EMR/Glue의 scikit-learn 또는 Spark MLlib)를 적용하십시오. 설명된 분산 비율을 검토하여 구성 요소 수를 선택하고, 로딩(loadings)을 검토하여 구성 요소를 원래 피처에 다시 매핑하십시오. 고유 벡터의 부호는 임의적이므로, 절대 로딩 값을 해석하고 크기별로 피처를 그룹화하십시오. 고도로 비선형적인 구조의 경우, t-SNE 또는 UMAP을 사용하되, 신중한 교차 검증 없이는 모델 전처리용이 아닌 시각화용으로만 사용하십시오. 클러스터링의 경우, 구형 클러스터에는 k-means(스케일링 필요), 소프트 할당에는 가우시안 혼합 모델, 밀도 기반 형태에는 DBSCAN을 선택하십시오. 실루엣 점수와 Davies-Bouldin 지수를 실행하여 비교하십시오. 대규모 데이터셋에서는 SageMaker 내장 k-means(GPU/CPU 인스턴스)를 사용하거나 SageMaker Processing에서 미니 배치 k-means를 실행하십시오. 원-핫 인코딩된 범주형 피처에 PCA를 적용하는 함정을 주의하십시오. 대신 피처 해싱 또는 임베딩 레이어를 고려하십시오. k를 결정하기 위해 엘보우 플롯, 설명된 분산 플롯, 하위 샘플에 대한 클러스터 안정성을 사용하십시오. 다운스트림의 실시간 스코어링 및 세그먼트 기반 모델이 일관된 변환을 사용하도록 클러스터 중심점과 PCA 변환기를 SageMaker Feature Store에 저장하십시오.

드리프트 및 성능에 대한 시각화, 모니터링 및 AWS 통합

시각화는 탐색적 목적과 운영적 목적을 모두 가집니다. 임시 플롯(ad-hoc plot)을 위해서는 SageMaker Studio에서 matplotlib/seaborn을 사용하고, 실시간 성능 지표를 추적하는 대시보드에는 Amazon QuickSight를 사용합니다. 모델 드리프트와 데이터 품질을 위해서는 SageMaker Model Monitor와 SageMaker Clarify를 통해 대표적인 훈련 샘플로 기준선(baseline)을 설정하여 분포 변화, 피처 중요도 변경, 편향(bias)을 탐지합니다. Processing 작업 아티팩트에서 파생된 기준선으로 Model Monitor를 구성하고, 배포된 엔드포인트에서 시간별/일별 검사를 통해 지속적인 모니터링을 활성화합니다. CloudWatch 이벤트와 SNS를 통해 경보를 트리거할 수 있습니다. 스트리밍 수집 및 분석을 위해서는 Kinesis Data Firehose를 사용하여 JSON을 S3에 Parquet 형식으로 변환하여 저장하거나(레코드 형식 변환 및 Glue Catalog 통합 활성화), Lambda를 연결하여 사용자 지정 변환을 수행합니다. 압축된 파일에 대해 거의 실시간으로 SQL 쿼리를 실행하려면, 데이터를 파티셔닝하여 Glue Data Catalog에 등록하고 Athena로 쿼리하며, 새로운 S3 객체가 도착하면 Lambda를 통해 파티션을 새로 고칩니다. 일반적인 함정으로는 기준선을 버전 관리하지 않거나, 스키마 변경(schema evolution)을 무시하거나(Glue Schema Registry 사용), 집계 지표에만 의존하는 것 등이 있습니다. 항상 피처별 드리프트와 세그먼트별 성능을 포함하여 국소적인 성능 저하를 탐지해야 합니다. SageMaker Experiments와 Model Monitor를 함께 사용하여 하이퍼파라미터 변경과 드리프트 이벤트를 연관시키고 데이터 계보(lineage)를 유지합니다.

실용적인 문제: 사용 사례 시나리오

시나리오: Acme Retailer는 SageMaker Studio, S3 데이터 레이크, Kinesis Firehose 수집, Glue Data Catalog, 그리고 시각화를 위한 QuickSight를 포함한 AWS ML 스택을 사용하고 있습니다. 이 팀은 고객 인구 통계, 세션 로그, 구매 내역을 S3에 JSON 및 Parquet 형식으로 저장합니다.

과제: 향후 6개월 내에 이탈할 가능성이 가장 높은 고객 세그먼트를 식별하고, 배포 후 피처 분포나 모델 성능에 드리프트가 발생하는지 탐지하기 위한 모니터링을 구축합니다.

권장 접근 방식:

  1. SageMaker Processing 작업(ml.m5.xlarge)을 생성하여 pandas/sklearn을 사용해 데이터를 샘플링하고 프로파일링하며, 적절한 경우 로그/Box–Cox 변환을 적용하고, 전처리 아티팩트를 SageMaker Feature Store에 등록합니다.
  2. 스케일링 후 PCA(scikit-learn 또는 Glue/EMR의 Spark ML)를 계산하여 차원을 축소하고, 설명된 분산(explained variance)과 로딩(loading)을 검토한 다음, SageMaker xgboost 또는 내장 k-means로 클러스터링을 수행하여 세그먼트를 도출합니다.
  3. 시간을 고려한(time-aware) 훈련/검증 데이터 분할을 사용하여 분류 모델(SageMaker의 XGBoost 또는 TensorFlow의 소규모 NN)을 훈련하고, 지표를 SageMaker Experiments에 기록하며, 불균형 데이터에 대해 조기 종료(early stopping) 및 클래스 가중치(class-weighting)를 설정합니다.
  4. SageMaker Endpoint로 배포하고, Processing 작업에서 생성된 기준선을 사용하여 Model Monitor를 활성화하며, 시간별 드리프트 검사와 SNS를 통한 알림을 위해 CloudWatch 경보를 구성합니다. 세그먼트 수준의 성능과 드리프트를 QuickSight에서 시각화합니다.

근거: 이 접근 방식은 세분화를 위해 강력한 전처리, 해석 가능한 차원 축소, 확장 가능한 클러스터링을 결합합니다. 동시에 SageMaker Model Monitor와 QuickSight는 데이터 및 성능 드리프트에 대한 운영상의 탐지를 제공하며, Feature Store를 통해 재현 가능한 전처리를 보장하고 추적된 실험을 통해 근본 원인 분석을 지원합니다.


데이터 엔지니어링 및 피처 엔지니어링 · 모든 도메인 · 모델링 — 지도 및 비지도 학습 (고전적 ML)

이 문제 연습하기 → · ExamRoll.io에서 시간 제한 연습 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

시험 합격하기 →

Amazon 찾아보기 →

Related guides

올인원 액세스

하나의 구독. 모든 시험.

모든 플랜은 무제한 답변 검색, 모의고사, AI 해설, 전체 자료 라이브러리를 20개 이상의 언어로 잠금 해제합니다.

월간
24.87
Just €0.83/day
모든 포함:
  • 무제한 답변 검색
  • 무제한 모의고사
  • AI 기반 해설
  • 전체 자료 라이브러리
  • 20개 이상의 언어
  • 주간 콘텐츠 업데이트
  • 보상 및 추천
  • 우선 지원
무료 체험 시작

신용카드 필요 없음*

최고의 가치
12개월
179.87
Just €0.49/daySave 40%
모든 포함:
  • 무제한 답변 검색
  • 무제한 모의고사
  • AI 기반 해설
  • 전체 자료 라이브러리
  • 20개 이상의 언어
  • 주간 콘텐츠 업데이트
  • 보상 및 추천
  • 우선 지원
무료 체험 시작

신용카드 필요 없음*

✓ 무료 플랜 포함 · ✓ 언제든지 취소 가능 · ✓ 모든 플랜은 전체 제품을 잠금 해제합니다