Amazon MLS-C01: 모델링 — 지도 및 비지도 학습 (고전적 ML) — 학습 가이드
다음의 일부입니다: AWS Machine Learning Specialty MLS-C01 — 학습 가이드. 검증된 답안으로 연습하기: Amazon 시험 허브, 또는 다음에서 시간 제한 모의고사 풀기: ExamRoll.io.
지도 학습 문제의 모델 선택 및 아키텍처
모델 선택은 데이터 형태와 프로덕션 제약 조건에서 시작됩니다. 많은 예제와 해석 가능한 계수를 가진 선형 신호의 경우, 정규화된 선형 또는 로지스틱 회귀(SageMaker LinearLearner 또는 scikit-learn ElasticNet)는 빠르고 검사할 수 있는 계수를 생성합니다. 비선형 상호작용이 지배적일 때는 XGBoost(SageMaker XGBoost 컨테이너)나 LightGBM과 같은 트리 앙상블이 과도한 피처 스케일링 없이 이질성을 포착합니다. 과적합을 제어하기 위해 eta(learning_rate), max_depth, subsample, colsample_bytree, 그리고 정규화 alpha/lambda를 조정하세요. SVM은 크기가 작거나 중간 정도이고 잘 스케일링된 피처 세트에 효과적일 수 있지만, 대규모 데이터셋은 비용이 많이 들기 때문에 일반적으로 SageMaker에서 사용자 지정 컨테이너나 scikit-learn ScriptMode가 필요합니다. 피처를 표준화하고 커널/정규화(C, gamma)를 신중하게 선택해야 합니다. Naive Bayes는 고차원의 희소 범주형/텍스트 입력에 대한 빠른 기준선입니다. 이는 조건부 독립을 가정하며 상관관계가 강할 때 성능이 저하됩니다. 수천 개의 피처나 매우 큰 데이터셋의 경우, 차원 축소(PCA)나 피처 해싱을 사용하고, GPU 기반 딥넷을 사용하는 경우 ml.c5 또는 ml.p3 인스턴스에서 분산 훈련을 선호하세요. 실시간 추론을 위해서는 SageMaker 엔드포인트로 배포하고, 대량 예측을 위해서는 Batch Transform을 사용하세요. 많은 모델을 유지 관리하여 비용을 절감해야 할 때는 Multi-Model Endpoints를 사용합니다.
지표, 불균형, 보정 및 배포 트레이드오프
정확도(Accuracy)는 매력적이지만 불균형 문제에서는 오해를 불러일으킬 수 있습니다. 클래스 균형을 강조할 때는 정밀도(precision), 재현율(recall), F1, ROC AUC와 같은 클래스 민감 지표를, 양성 클래스가 드물 때는 PR AUC를 선호하세요. 확률을 생성할 때는 신뢰도 다이어그램(reliability diagrams)과 Brier 점수로 보정(calibration)을 확인하세요. 오프라인으로 구현된 Platt 스케일링이나 isotonic 보정(scikit-learn CalibratedClassifierCV)을 사용하거나, 원시 점수(raw scores)를 출력하고 후처리 단계를 적용하여 SageMaker 훈련 내에서 보정할 수 있습니다. 클래스 불균형을 처리하려면 샘플 가중치(SageMaker LinearLearner 및 많은 훈련 스크립트에서 지원), 훈련 중 목표 오버샘플링(SMOTE) 또는 언더샘플링, 그리고 신경망을 위한 손실 재가중(loss re-weighting) 또는 focal loss를 선호하세요. 사기 확률의 거의 실시간 스코어링을 위해, 추론 지연 시간이 낮은 인스턴스 유형(ml.m5.large 또는 CPU 최적화 인스턴스)을 사용하여 모델 지연 시간을 최적화하고, 모델을 작게 유지하며(가지치기(prune) 또는 증류 모델(distilled models) 사용), SageMaker 엔드포인트를 통해 다중 모델 엔드포인트나 A/B 트래픽 전환을 사용하여 업데이트를 안전하게 롤아웃하세요. SageMaker Model Monitor로 프로덕션 드리프트와 데이터 품질을 모니터링하고, CloudWatch로의 지표 로깅을 자동화하세요.
피처 엔지니어링, 다중공선성 및 정규화
다중공선성(Multicollinearity)은 선형 모델에서 계수 추정치의 분산을 부풀립니다. 분산 팽창 계수(VIF)와 쌍별 피어슨 상관관계(pairwise Pearson correlation)로 이를 탐지하고, 중복 피처를 제거하거나 차원 축소(PCA, SVD)를 사용하여 완화하세요. 정규화(Regularization)는 원칙에 입각한 해결책입니다. L2(Ridge)는 계수를 축소하고, L1(Lasso)은 피처 선택을 위해 희소성(sparsity)을 유도하며, ElasticNet은 둘을 결합합니다. 이들은 scikit-learn과 SageMaker LinearLearner에서 사용할 수 있습니다. 강하게 치우친 숫자형 피처에는 로그 또는 Box-Cox 변환을 적용하여 분산을 안정시키고 선형 모델의 적합도를 개선하세요. 트리 앙상블은 단조 변환(monotonic transforms)에 강건한 반면, SVM과 신경망은 안정적인 훈련을 위해 표준화된 입력(StandardScaler)이 필요하다는 점을 기억하세요. 고유값 개수(cardinality)가 많은 범주형 피처는 타겟 인코딩, 임베딩 또는 해싱의 이점을 얻을 수 있습니다. 타겟 인코딩을 사용할 때는 교차 검증 폴드 내에서 인코딩을 계산하거나 별도의 홀드아웃(holdout) 세트를 사용하여 정보 누수(leakage)를 방지하세요. SageMaker Feature Store를 사용하여 훈련과 추론 모두에 일관된 피처 변환을 중앙에서 제공하고, 프로덕션 변환이 훈련과 일치하도록 전처리 코드를 모델 패키지 또는 Docker 이미지와 함께 영속화하세요.
비지도 학습 방법, 클러스터링, 이상 탐지 및 해석 가능성
클러스터링과 이상 탐지는 탐색적 도구이자 지도 학습 모델링을 위한 전처리 단계입니다. K-means (SageMaker k-means)는 빠르지만 구형 클러스터를 가정하고 스케일링된 피처를 필요로 합니다. 관성(inertia)은 모호할 수 있으므로 실루엣 점수나 엘보우 플롯을 사용하여 k를 신중하게 선택해야 합니다. 밀도 기반 방법(DBSCAN)과 계층적 클러스터링은 비구형 구조를 포착할 수 있지만 계산 비용이 더 많이 듭니다. 대규모 이상 탐지를 위해서는 스트리밍 센서 데이터에 SageMaker Random Cut Forest를, 거의 실시간에 가까운 스코어링을 위해서는 Kinesis/Lambda 파이프라인을 고려하십시오. 민감도를 제어하려면 트리 수와 샘플 크기를 조정해야 합니다. 해석 가능성 도구는 매우 중요합니다. 트리 모델에는 모델 네이티브 피처 중요도를 사용하고, 로컬 설명 및 전역 효과 요약을 위해서는 SHAP 값(SageMaker Clarify 또는 SHAP 패키지)을 사용하십시오. 일반적인 함정에 주의하십시오: 시간 순서가 있는 데이터를 무작위로 분할할 때 발생하는 시간적 누수(temporal leakage), 불균형 데이터셋에서 정확도에 과도하게 의존하는 것, Naive Bayes에 대한 독립성 가정 등이 있습니다. 배포 시에는 필요에 따라 Docker에 사용자 지정 알고리즘을 패키징하고, 예측 및 상태 확인 엔드포인트를 노출하며, 엔드포인트 트래픽 분할을 통해 카나리 롤아웃을 오케스트레이션합니다.
실전 문제: FleetSight Logistics — 트럭 이미지에 대한 탐색적 ML
시나리오: FleetSight는 S3에 저장된 하루 약 100GB의 트럭 이미지를 수집하고, 실험에는 SageMaker Studio를, 이미지 레이블링에는 SageMaker Ground Truth를 사용합니다. 이들은 결함 탐지를 위한 경량 ML 기능이 필요하며, 향후 확장을 계획하고 있습니다.
과제: 실현 가능한 지도/비지도 학습 사용 사례를 식별하고, 제한된 레이블로 초기 모델을 훈련하며 경고를 위한 거의 실시간 추론을 수행할 수 있는 저비용 파이프라인을 구축합니다.
권장 접근 방식:
- 능동 학습(active learning) 기능이 있는 SageMaker Ground Truth를 사용하여 시드 데이터셋에 레이블을 지정합니다. 레이블이 지정된 데이터는 S3에 저장하고 피처는 SageMaker Feature Store에 등록합니다.
- 이미지에서 파생된 센서 메타데이터와 간단한 이미지 임베딩에 SageMaker Random Cut Forest를 사용하여 비지도 이상 탐지를 시작합니다 (GPU ml.p3.2xlarge를 사용하는 SageMaker Notebook에서 사전 훈련된 CNN으로 임베딩 추출).
- 레이블이 지정된 서브셋에 대해 전이 학습(SageMaker 내장 TensorFlow 또는 PyTorch 컨테이너)을 사용하여 경량 지도 학습 분류기를 훈련합니다. 빠른 기준 모델을 위해서는 임베딩을 추출하고 CPU 인스턴스에서 XGBoost 모델(SageMaker XGBoost)을 훈련합니다.
- 비용 효율성을 위해 비동기식 추론(async inference) 또는 다중 모델 엔드포인트(Multi-Model Endpoint)를 사용하여 XGBoost 모델을 SageMaker 엔드포인트에 배포합니다. SageMaker Model Monitor로 입력과 예측을 모니터링하고 Ground Truth를 통해 레이블링을 반복합니다.
근거: 비지도 임베딩 + Random Cut Forest를 사용하여 레이블이 많지 않은 상태에서 이상 후보를 찾은 다음, 전이 학습과 XGBoost를 통해 지도 학습 모델을 부트스트랩하여 작고 빠른 추론을 구현합니다. SageMaker 서비스는 통합되고 확장 가능한 개발 및 모니터링 워크플로우를 제공합니다.
← 탐색적 데이터 분석 및 시각화 · 모든 도메인 · 딥러닝 및 컴퓨터 비전 →
이 문제 연습하기 → · ExamRoll.io에서 시간 제한 연습 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
시험 합격하기 →