Amazon AIF-C01: MLOps 및 배포 — 학습 가이드

다음의 일부입니다: AWS AI Practitioner AIF-C01 — 학습 가이드. 검증된 답안으로 연습하기: Amazon 시험 허브, 또는 다음에서 시간 제한 모의고사 풀기: ExamRoll.io.

배포 및 추론 패턴: 실시간, 배치, 서버리스, 엣지

추론 패턴을 선택하는 것은 지연 시간, 처리량, 비용, 운영 복잡성이라는 서비스 수준의 트레이드오프를 고려하는 것에서 시작됩니다. 지연 시간이 짧고 처리량이 높은 요구 사항에는 프로비저닝된 Amazon SageMaker 실시간 엔드포인트(단일 모델 또는 다중 모델 엔드포인트) 또는 오토스케일링 및 GPU 인스턴스를 사용하는 SageMaker Real-Time Inference가 일반적입니다. 엔드포인트 변형(variant)을 사용하여 카나리 또는 블루/그린 롤아웃을 구현할 수 있습니다. 지연 시간이 중요하지 않은 대규모 오프라인 작업의 경우, SageMaker Batch Transform이나 AWS Glue/EMR에서의 분산 처리가 비용 효율적이고 확장이 간단합니다. 예측 불가능하거나 QPS가 낮은 워크로드의 경우, SageMaker Serverless Inference 또는 AWS Lambda에서 모델을 호출(필요시 프로비저닝된 동시성 사용)하면 관리 오버헤드와 비용을 줄일 수 있습니다. 엣지 배포는 SageMaker Edge Manager로 모델을 패키징하고, 간헐적인 연결성과 엄격한 지연 시간 또는 개인 정보 보호 요구 사항이 있는 디바이스를 위해 AWS IoT Greengrass를 통해 배포해야 합니다. 실무에서 흔히 저지르는 실수로는 드문 트래픽에 실시간 엔드포인트를 선택하여 높은 비용을 초래하거나, 서버리스 배포의 콜드 스타트를 테스트하지 않거나, 다중 모델 엔드포인트의 메모리/GPU 요구 사항을 과소평가하는 것 등이 있습니다. 결정은 SLO(p99 지연 시간, 처리량), 모델 크기, 동시성 패턴, 예상 업데이트 빈도를 기준으로 해야 하며, 호스팅 패턴을 결정하기 전에 대표적인 트래픽으로 프로파일링하는 것이 중요합니다.

반복 가능한 전달을 위한 모델 레지스트리, 파이프라인, CI/CD

견고한 프로덕션 워크플로는 SageMaker Model Registry를 사용하여 아티팩트를 버전 관리하고, 모델 리니지를 캡처하며, 승인 워크플로를 관리하고, SageMaker Pipelines를 사용하여 반복 가능한 훈련, 검증, 배포 단계를 구성합니다. Git 기반 소스 제어를 AWS CodePipeline 및 CodeBuild와 통합하면 모델 코드 CI가 가능해집니다. 즉, 단위 테스트, 데이터 스키마 검사, 레지스트리 승격을 제어하는 자동화된 모델 평가를 수행할 수 있습니다. 배포 자동화는 단계별 환경(dev → staging → prod)을 구현해야 하며, 엔드포인트 변형, 블루/그린 배포 또는 Lambda 기반 라우팅을 통해 자동 롤백이나 트래픽 전환을 지원해야 합니다. 피처 스토어(SageMaker Feature Store)는 피처 정의와 타임스탬프를 저장하여 훈련과 추론의 일관성을 보장합니다. 흔한 실수로는 하이퍼파라미터와 환경 버전을 기록하지 않거나, 검증 테스트(데이터 스키마, 성능 임계값)를 자동화하지 않거나, 불변의 아티팩트가 없는 것(모델 아티팩트를 S3 또는 ECR에 저장) 등이 있습니다. 엔드포인트 구성에는 코드형 인프라(CloudFormation 또는 CDK)를 사용하고, 라이브러리와 시드(seed)를 고정하여 재현성을 보장하며, 동일한 파이프라인에 통합된 재훈련 트리거(데이터 드리프트, 주기적 스케줄)를 계획해야 합니다.

모니터링, Model Monitor 및 운영 제어

운영 모니터링은 데이터 드리프트, 컨셉 드리프트, 성능 저하, 지연 시간, 리소스 사용률을 포함해야 합니다. Amazon SageMaker Model Monitor는 훈련 데이터 분포를 기준으로 삼아 추론 트래픽을 지속적으로 프로파일링하여 피처 드리프트, 결측값, 스키마 변경을 감지할 수 있습니다. 정답(ground truth) 데이터를 사용할 수 있는 경우, Model Monitor는 예측 품질과 타겟 드리프트도 추적할 수 있습니다. 추론 로깅을 Amazon S3 및 CloudWatch로 보내도록 설정하고, 실시간 경고 및 자동화된 파이프라인 트리거를 위해 로그를 Amazon Kinesis 또는 Amazon EventBridge로 스트리밍하세요. 모든 드리프트 경고를 재훈련 신호로 취급하거나(일시적인 변화나 계절성으로 인해 오탐이 발생할 수 있음), 자연적인 편차를 이해하지 않고 임계값을 설정하는 것과 같은 흔한 실수를 피해야 합니다. 불균형 클래스의 경우, 의미 있는 성능 저하를 감지하기 위해 정확도(accuracy)보다 정밀도(precision), 재현율(recall), F1 점수를 선호해야 합니다. 모델 아티팩트에 대해 RBAC와 암호화(KMS)를 구현하고, 안전한 서비스 액세스를 위해 VPC 엔드포인트와 AWS PrivateLink를 사용하며, AWS CloudTrail을 통해 감사 추적을 캡처해야 합니다. 문제 해결을 위한 운영 플레이북을 유지 관리하세요. 데이터 파이프라인을 검증하고, 최근 코호트의 성능을 비교하며, 재훈련, 롤백 또는 보정 및 피처 수정을 적용합니다.

설명 가능성, 모델 카드 및 규정 준수 지원 제어

설명 가능성은 운영 가능하고, 감사 가능하며, 이해관계자의 요구에 맞게 조정되어야 합니다. Amazon SageMaker Clarify는 사전 훈련 편향 검사, 사후 훈련 편향 지표, 그리고 추론 시 또는 오프라인 배치에서 생성할 수 있는 SHAP을 통한 예측별 특성 기여도를 제공합니다. 런타임 설명은 예측 및 입력 핑거프린트와 함께 로깅하여 추적성을 제공해야 합니다. 설명은 S3에 저장하고 검색을 위해 인덱싱합니다. 모델 카드는 의도된 사용 사례, 데이터 출처, 관련 슬라이스에 대한 평가 지표, 알려진 한계, 성능 관련 주의 사항을 문서화합니다. 거버넌스를 충족하기 위해 모델 레지스트리 내에서 모델 카드 버전을 유지 관리합니다. 금융 및 규제 대상 사용 사례에는 결정론적 감사 추적이 필요합니다. 모델 아티팩트, 하이퍼파라미터, 평가 데이터, 설명 로그를 보존하고, 영향이 큰 결정에 대해서는 human-in-the-loop 승인 게이트를 구현하며, 까다로운 사례에 대해서는 반사실적 설명을 유지 관리합니다. 관리형 파운데이션 모델과의 안전한 통합을 위해, VPC 내에서 Amazon Bedrock을 호출할 때는 AWS PrivateLink 인터페이스 엔드포인트를 사용하고, KMS로 페이로드를 암호화하며, 세분화된 IAM 및 네트워크 제어를 적용합니다. 임베딩 저장 및 벡터 검색을 위한 서비스 선택은 검색 요구 사항에 따라 달라집니다. 성능과 운영 비용을 기준으로 옵션을 비교해 보세요.

실제 문제: 사용 사례 시나리오

시나리오: FinSight는 AWS에서 신용 결정 파이프라인을 운영하며, 모델 훈련에는 SageMaker, 보조 생성형 설명에는 Bedrock, 데이터 저장에는 Amazon S3를 사용합니다. 모델은 VPC 내의 SageMaker 실시간 엔드포인트로 배포되며, 들어오는 특성을 프로파일링하기 위해 Model Monitor가 활성화되어 있습니다.

과제: Model Monitor가 임계값을 초과하는 특성 드리프트를 감지했으며, 비즈니스 규정에 따라 자동화된 신용 한도 변경에 대해 감사 가능하고 설명 가능한 결정이 요구됩니다.

권장 접근 방식:

  1. SageMaker Model Monitor 경보를 사용하여 EventBridge 규칙을 트리거하고, 드리프트 데이터를 SageMaker Pipelines 재훈련 워크플로로 전송하며, 현재 추론 데이터와 최근 입력 데이터를 스냅샷하여 S3 격리 버킷에 저장합니다.
  2. SageMaker Pipelines 내에서 자동화된 검증 작업을 실행하여 최근 데이터 분포를 기준선과 비교하고, 평가 지표(정밀도/재현율/F1)를 계산하며, 대표적인 코호트에 대해 SageMaker Clarify를 사용하여 샘플별 SHAP 설명을 생성합니다.
  3. 자동화된 검사가 통과하면, 성능 슬라이스와 설명을 담은 업데이트된 모델 카드로 새 모델을 SageMaker Model Registry에 등록합니다. 단계적 배포를 위해 엔드포인트 변형 및 트래픽 이동을 사용합니다. 검사가 실패하면 운영 큐에 인시던트를 생성하고 배포 전에 사람의 검토 단계를 호출합니다.
  4. 사람이 읽을 수 있는 설명을 생성하는 안전한 Bedrock 호출을 위해, AWS PrivateLink를 통해 Bedrock 트래픽을 라우팅하고 KMS로 페이로드를 암호화합니다. 모든 설명 출력은 S3에 로깅하고 감사 가능성을 위해 추론 레코드에 연결합니다.

근거: 이 접근 방식은 자동화된 탐지, 재현 가능한 검증, 보호된 배포를 감사 추적 및 결정별 설명과 결합합니다. 이를 통해 운영 제어를 규제 투명성에 맞추고 잘못된 재훈련/롤백 조치를 최소화합니다.


모델 훈련 · 모든 도메인 · AI

이 문제 연습하기 → · ExamRoll.io에서 시간 제한 연습 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

시험 합격하기 →

Amazon 찾아보기 →

Related guides

올인원 액세스

하나의 구독. 모든 시험.

모든 플랜은 무제한 답변 검색, 모의고사, AI 해설, 전체 자료 라이브러리를 20개 이상의 언어로 잠금 해제합니다.

월간
24.87
Just €0.83/day
모든 포함:
  • 무제한 답변 검색
  • 무제한 모의고사
  • AI 기반 해설
  • 전체 자료 라이브러리
  • 20개 이상의 언어
  • 주간 콘텐츠 업데이트
  • 보상 및 추천
  • 우선 지원
무료 체험 시작

신용카드 필요 없음*

최고의 가치
12개월
179.87
Just €0.49/daySave 40%
모든 포함:
  • 무제한 답변 검색
  • 무제한 모의고사
  • AI 기반 해설
  • 전체 자료 라이브러리
  • 20개 이상의 언어
  • 주간 콘텐츠 업데이트
  • 보상 및 추천
  • 우선 지원
무료 체험 시작

신용카드 필요 없음*

✓ 무료 플랜 포함 · ✓ 언제든지 취소 가능 · ✓ 모든 플랜은 전체 제품을 잠금 해제합니다