Amazon MLS-C01: MLOps, 모니터링, 레이블링 및 모델 거버넌스 — 학습 가이드
다음의 일부입니다: AWS Machine Learning Specialty MLS-C01 — 학습 가이드. 검증된 답안으로 연습하기: Amazon 시험 허브, 또는 다음에서 시간 제한 모의고사 풀기: ExamRoll.io.
파이프라인, CI/CD 및 자동화
프로덕션 수준의 ML은 데이터 수집, 검증, 훈련, 튜닝, 모델 패키징, 배포를 반복 가능한 파이프라인으로 연결하는 엔드투엔드 자동화를 필요로 합니다. Amazon SageMaker Pipelines를 사용하여 Processing 작업(Data Wrangler 또는 ScriptProcessor), Training(Distributed Data Parallel 또는 XGBoost/BlazingText를 사용한 관리형 훈련), Hyperparameter Tuning(목표 지표 및 훈련 작업 StoppingCondition을 사용하는 HyperparameterTuningJob), SageMaker Model Registry에 모델 등록 단계를 정의합니다. 코드 수준의 CI 확인 및 단위 테스트를 위해 Pipelines를 AWS CodePipeline 및 CodeBuild와 통합하고, CloudFormation 또는 CDK를 사용하여 일관된 환경을 프로비저닝합니다. 변경되지 않은 작업을 다시 실행하지 않도록 단계에 캐싱을 구성하고, 파이프라인 입력(S3 접두사, 인스턴스 유형)을 파라미터화합니다. HPO의 경우, MaxNumberOfTrainingJobs에만 의존하지 마십시오. 과도한 비용 발생을 피하기 위해 훈련 작업별 StoppingCondition(MaxRuntimeInSeconds)도 설정하고, 가능한 경우 자동 조기 중단을 활성화하십시오. 흔히 저지르는 실수로는 계속 증가하는 데이터셋에 File 모드를 사용하는 것(대규모 데이터셋의 경우 Pipe 모드 또는 분산 훈련으로 전환), 데이터셋과 피처를 버전 관리하지 않는 것, 재훈련 전에 데이터 검증 게이트(SageMaker Processing + Deequ 또는 Data Wrangler 확인)를 포함하지 않는 것 등이 있습니다. 데이터베이스 내 모델(Redshift ML)과 SageMaker 간의 결정 기준은 모델 복잡성, 지연 시간, 운영 제어에 기반합니다. Redshift ML은 SQL 내의 간단한 XGBoost 모델에 편리하며, SageMaker는 딥넷, 사용자 지정 아키텍처, 확장 가능한 엔드포인트에 필요합니다.
모니터링, 드리프트 탐지 및 모델 품질
지속적인 모니터링은 모델 성능과 데이터 품질을 모두 포착해야 합니다. SageMaker 모델 엔드포인트의 데이터 캡처를 활성화하여 요청과 응답을 S3에 저장한 다음, SageMaker Model Monitor 기준선 작업으로 훈련 데이터 분포의 기준선을 설정합니다. 스키마 위반 및 단변량 드리프트 지표에는 내장된 Model Monitor 검사를 사용하고, 분포 변화의 경우 KL 다이버전스, PSI(Population Stability Index), KS 테스트를 계산하고 드리프트 임계값에 대해 CloudWatch 경보를 설정합니다. 모델 지표를 추적합니다—분류: 정밀도/재현율, ROC AUC, 혼동 행렬 및 클래스별 FPR/FNR; 회귀: RMSE, MAE, MAPE. Clarify는 훈련 전후 시점에 편향 및 설명 가능성 검사를 실행하고 SHAP 기반 피처 어트리뷰션을 생성할 수 있습니다. Clarify를 사용하여 하위 그룹 성능 불균형(민감한 속성)을 탐지하십시오. 일반적인 운영상의 함정으로는 추론 컨텍스트(피처 매핑, 모델 버전, 요청 ID)를 캡처하지 않는 것, 레이블 지연 시간(지연된 레이블은 시기적절한 평가를 방해함)을 무시하는 것, 모집단 변화와 개념 드리프트를 혼동하는 것 등이 있습니다. 이들은 다르게 처리해야 합니다(재훈련 vs 레이블 수집 및 피처 재평가). 알림을 위해 집계된 지표와 드리프트 표시기를 CloudWatch로 푸시하고, 임계값을 초과하면 SageMaker Pipelines를 통해 롤백 또는 재훈련을 자동화합니다.
레이블링, 데이터 준비 및 피처 엔지니어링
품질 좋은 레이블과 일관된 피처 파이프라인은 기본입니다. Amazon SageMaker Ground Truth를 사용하여 자동 사전 레이블링(모델 지원 레이블링), 액티브 러닝, 주석 통합 기능을 갖춘 레이블링 워크플로를 생성하십시오. 작업자 유형(프라이빗 인력, 공급업체 또는 퍼블릭)을 선택하고, 레이블 검증 및 주석자 간 일치도 지표를 구성합니다. EDA 및 변환을 위해 SageMaker Data Wrangler로 데이터셋을 가져와 분포를 프로파일링하고, 결측치를 대체하며, 처리 스크립트를 SageMaker Processing 작업으로 내보냅니다. 일관된 런타임 검색과 간단한 백필을 위해 Amazon SageMaker Feature Store에 온라인 및 오프라인 피처를 저장합니다. 인코딩 결정은 규모와 카디널리티에 따라 달라집니다. 낮은 카디널리티의 범주형 데이터는 원-핫 인코딩할 수 있고, 높은 카디널리티의 항목(예: 100개의 제품 SKU)은 타겟 인코딩 또는 임베딩(TensorFlow/PyTorch 임베딩 레이어 또는 SageMaker 내장 알고리즘)을 사용하며, 다중 선택 설문 응답은 멀티-핫 벡터로 매핑합니다. 일일 메타데이터를 추가할 때 발생하는 레이블 누수(피처 엔지니어링 윈도우 및 누수 테스트 포함), 매우 큰 S3 데이터셋에 File 모드를 사용하는 것(Pipe 모드는 레코드를 스트리밍하고 다중 인스턴스 분산 훈련을 지원함), 변환을 버전 관리하지 않는 것과 같은 일반적인 함정에 주의하십시오. 훈련과 추론 간의 동등성을 보장하기 위해 Data Wrangler 변환을 재사용 가능한 Processing/Training 단계로 내보내야 합니다.
설명 가능성, 거버넌스, ML 팀 확장
설명 가능성과 거버넌스에는 실행 가능한 아티팩트와 감사 추적 기록이 필요합니다. SageMaker Clarify를 사용하여 훈련 전 편향 지표와 훈련 후 특성 기여도(SHAP)를 계산하고, 그 결과를 Model Registry 항목과 함께 저장합니다. 승인 상태, 서명된 ModelPackageGroups, 자동화된 승격 게이트를 사용하여 SageMaker Model Registry에 모델을 등록합니다. SageMaker Experiments로 실험과 계보를 추적하고, CloudTrail을 활성화하여 API 호출을 감사합니다. 설명 가능성 기법의 경우, 트리 모델(XGBoost 내장 SHAP)에는 모델 네이티브 특성 중요도를 선호하고, 딥 네트워크에는 SHAP 또는 통합 그래디언트(integrated gradients)를 사용하되 런타임 비용에 유의해야 합니다. 배치 고객을 위해 오프라인으로 설명을 사전 계산하고, 실시간 요청에는 요약 정보를 노출합니다. 거버넌스 모범 사례에는 데이터셋 설명, 공정성 검사, 문서화된 비즈니스 규칙이 포함된 모델 카드와 모델 배포 시 IAM 최소 권한 원칙 적용이 포함됩니다. 팀을 확장하려면 파이프라인을 모듈화하고, 전처리/검증을 위한 표준 템플릿을 만들고, Feature Store를 중앙 집중화하며, 드리프트 탐지 및 재훈련 트리거를 자동화하여 데이터 사이언티스트가 운영(ops)보다는 개선에 집중할 수 있도록 해야 합니다. 흔한 함정으로는 인과 관계를 파악하기 위해 특성 중요도에 과도하게 의존하거나, 배포된 모델에 대한 감사 로그를 유지하지 않거나, 지연 시간이 짧은 엔드포인트에서 비용이 많이 드는 설명 가능성 계산을 동기적으로 노출하는 것 등이 있습니다.
실제 문제: 사용 사례 시나리오
시나리오: Acme Manufacturing은 간헐적으로 연결이 끊기는 원격 센서 플릿을 운영하며, 중앙 집계를 위해 AWS IoT와 S3를 사용합니다. 이 회사의 AWS ML 환경에는 SageMaker, IoT Core, Kinesis Data Streams, Greengrass가 활성화된 엣지 디바이스가 포함됩니다.
과제: 연결이 간헐적인 원격 사이트에서 지연 시간이 짧은 이상 탐지를 제공하는 동시에, Direct Connect 없이 중앙 집중식 재훈련 및 드리프트 탐지를 위해 원격 측정 데이터를 수집해야 합니다.
권장 접근 방식:
- SageMaker Neo로 컴파일된 소형 이상 탐지 모델을 엣지 디바이스의 AWS IoT Greengrass에 배포하여 실시간 로컬 추론 및 작업(로컬 알람, 단기 버퍼링)을 수행합니다.
- 요약된 원격 측정 데이터와 이상 플래그를 AWS IoT Core를 통해 Amazon Kinesis Data Streams로 스트리밍하고, Kinesis Data Firehose를 사용하여 원시 및 집계 데이터를 중앙 저장을 위해 S3(parquet 형식)에 영구 저장합니다.
- S3 배치를 수집하고, 처리 작업(Data Wrangler)을 실행하여 기준선을 계산하고 특성 공학을 수행하며, 필요에 따라 HyperparameterTuningJobs를 트리거하고, 검증된 모델을 SageMaker Model Registry에 등록하는 SageMaker Pipeline을 구축합니다.
- 중앙 엔드포인트에서 SageMaker Model Monitor를 활성화하고, 엣지에서 수집된 분포를 훈련 기준선(PSI/KL)과 비교하는 배치 작업을 예약합니다. 또한 샘플링된 경고에 SageMaker Ground Truth를 사용하여 사람이 레이블을 지정하도록 함으로써 피드백 루프를 완성합니다.
근거: Greengrass + Neo를 통한 엣지 추론은 간헐적인 연결 상태에서도 지연 시간이 짧은 의사 결정을 보장합니다. Kinesis + Firehose는 재훈련을 위해 S3로 안정적이고 순서가 보장된 수집을 보장합니다. SageMaker Pipelines와 Model Registry는 반복 가능한 재훈련, 버전 관리, 드리프트 검사를 통한 자동 승격을 제공하여 모델 품질을 유지합니다.
이 문제 연습하기 → · ExamRoll.io에서 시간 제한 연습 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
시험 합격하기 →