Amazon MLS-C01: 배포, 추론 및 서빙 (ML 구현 및 운영) — 학습 가이드

다음의 일부입니다: AWS Machine Learning Specialty MLS-C01 — 학습 가이드. 검증된 답안으로 연습하기: Amazon 시험 허브, 또는 다음에서 시간 제한 모의고사 풀기: ExamRoll.io.

배포 패턴 및 서빙 옵션

모델 서빙 선택은 지연 시간, 비용, 처리량 및 운영 복잡성 간의 균형을 맞추는 문제입니다. 실시간 SageMaker 엔드포인트(프로비저닝 또는 서버리스)는 대화형 API에 적합한 100ms 미만에서 수 초 사이의 지연 시간을 제공합니다. CPU 모델에는 ml.c5/m5, GPU 모델에는 ml.g4dn 또는 ml.p3, 저비용 고처리량 Inferentia 추론에는 ml.inf1과 같은 인스턴스 패밀리를 선택합니다. 비동기 추론 및 배치 변환은 대규모 배치 또는 가변 지연 시간 사용 사례에 적합합니다. 배치 변환은 대규모 오프라인 작업에 이상적이며(큰 S3 객체를 샤드로 분할하고 필요에 따라 ml.m5/c5 또는 GPU 인스턴스 사용), SageMaker 비동기 추론은 큐잉을 통해 더 큰 페이로드를 지원하여 거의 실시간에 가까운 배치를 처리할 수 있습니다. 다중 모델 엔드포인트는 단일 컨테이너 뒤에서 여러 모델을 호스팅하며, 필요 시 모델을 로드하여 스토리지 오버헤드를 줄입니다. 이는 모델이 작고, 콜드 스타트 비용이 적당하며, 액세스 패턴이 드문 경우에 가장 효과적입니다. 예측 불가능하고 처리량이 낮은 워크로드의 경우 인스턴스 관리를 피하기 위해 SageMaker Serverless Inference를 선택하세요. 단, 콜드 스타트와 제한된 런타임에 유의해야 합니다. 주요 결정 기준에는 지연 시간 SLO, 호출당 비용, 동시성 패턴, 모델 크기, 콜드 스타트 허용 범위가 포함됩니다. 흔한 함정은 매우 높은 볼륨의 배치 워크로드에 실시간 엔드포인트를 사용하는 것입니다. 이는 비용이 많이 듭니다. 대신 배치 변환, 비동기 추론을 사용하거나, 배치 처리 및 동시 작업자를 통해 엔드포인트를 호출해야 합니다.

스케일링, 트래픽 셰이핑 및 비용 최적화

오토스케일링, 트래픽 전환 및 비용 제어는 배포 토폴로지와 함께 설계되어야 합니다. 호출 지표 또는 사용자 지정 CloudWatch 지표를 기반으로 하는 대상 추적 정책을 사용하여 Application Auto Scaling으로 SageMaker 엔드포인트 변형을 스케일링하세요. 스래싱(thrashing)을 방지하기 위해 합리적인 최소/최대 용량과 재사용 대기시간(cooldown)을 정의해야 합니다. 블루/그린 배포 및 카나리 롤아웃의 경우, 다중 변형 엔드포인트 또는 트래픽 분할 비율과 점진적 증가를 사용하는 EndpointConfig 업데이트를 활용하세요. AWS CodeDeploy와 통합하여 트래픽 전환을 자동화합니다. 비용 최적화에는 모델 프루닝, 양자화(FP16 또는 int8), SageMaker Neo 또는 AWS Neuron for Inf1으로 컴파일, 지연 시간에 민감하지 않은 워크로드를 배치 변환 또는 서버리스 추론으로 이전하는 것이 포함됩니다. 스팟 인스턴스는 훈련 비용을 절감하지만 실시간 엔드포인트에는 적용할 수 없습니다. 대신 인스턴스 유형(cpu vs gpu vs inferentia)을 적정 규모로 조정하고, 적절한 경우 다중 모델 엔드포인트로 모델을 통합해야 합니다. 인스턴스당 처리량을 이해하지 못한 채 대상 추적을 사용하여 과도하게 프로비저닝하거나, 다중 모델 엔드포인트가 메모리 제한을 없앤다고 가정하는 것과 같은 함정을 주의하세요. 모델 로딩은 여전히 메모리를 필요로 하며 지연 시간을 증가시킬 수 있습니다. 또한 모델 아티팩트(ONNX, gz로 압축된 TF SavedModel)를 압축하고 지연 로딩(lazy-loading) 전략을 사용하여 스토리지 및 콜드 스타트 시간을 줄이세요.

엣지, 저지연 추론 및 전/후처리 배치

초저지연 또는 연결이 끊어진 환경의 경우 AWS IoT Greengrass (v2)에 모델을 배포하거나 SageMaker Edge Manager를 사용하여 엣지 디바이스의 모델을 패키징하고 모니터링하세요. SageMaker Neo 또는 AWS IoT Greengrass 구성 요소로 컴파일하고 양자화를 사용하여 메모리/CPU 제약 조건을 충족시키세요. 전처리 및 특징 추출은 엔드투엔드 지연 시간과 비용을 최소화할 수 있는 곳에 배치해야 합니다. 간단한 필터는 디바이스 펌웨어나 Greengrass Lambda에서 실행할 수 있으며, 배치 처리 및 무거운 변환은 엣지 게이트웨이나 클라우드에서 수행하는 것이 적합합니다. 스트리밍 이벤트 윈도우(예: 10분 슬라이딩 윈도우)의 경우, Amazon Kinesis Data Streams 또는 Amazon MSK로 수집하고, Kinesis Data Analytics 또는 Flink/Apache Spark를 사용하여 윈도우잉 및 집계를 수행한 후, 요약된 특징을 SageMaker 엔드포인트나 경량 엣지 모델로 전달하세요. 이는 네트워크 이그레스(egress)와 모델 호출 빈도를 줄여줍니다. 엣지 디바이스에서 모델 버전 관리를 무시하거나, 모델 아티팩트를 위한 충분한 디바이스 스토리지를 프로비저닝하지 못하는 것과 같은 함정에 유의하세요. 서버 측 마이크로서비스의 경우, 콜드 콜 오버헤드를 피하고 모델로 전송되는 페이로드 크기를 줄이기 위해 전처리(API Gateway + Lambda 또는 ALB + Fargate)를 동일한 위치에 배치하세요.

모니터링, 감사, 거버넌스 및 데이터 처리

운영 ML(Operational ML)은 지속적인 모델 상태 및 데이터 거버넌스를 필요로 합니다. SageMaker Model Monitor를 사용하여 DataQualityJob으로 훈련 데이터의 기준선을 설정하고, 데이터 드리프트, 모델 품질 저하, 결측값 및 사용자 지정 제약 조건을 탐지하기 위한 지속적인 모니터링을 구성합니다. 엔드포인트에서 DataCaptureConfig를 활성화하여 입/출력을 S3에 캡처하고 Model Monitor 작업을 트리거합니다. 피처 수준의 리니지 및 감사를 위해 Amazon SageMaker Feature Store(온라인 및 오프라인 스토어)를 AWS Glue Data Catalog 및 CloudTrail과 결합하여 데이터 세트 액세스 및 변환을 추적합니다. Amazon Macie 및 Glue/SageMaker Processing 작업은 훈련 전에 PII를 탐지하고 수정(redact)할 수 있습니다. 암호화의 함정에는 SSE-KMS가 포함됩니다. S3 객체가 고객 관리형 CMK로 암호화된 경우, SageMaker 실행 역할에 kms:Decryptkms:GenerateDataKey 권한이 있는지, 그리고 CMK 정책이 액세스를 허용하는지 확인해야 합니다. 또한 S3 버킷 정책과 VPC 엔드포인트가 액세스를 차단하지 않는지 확인해야 합니다. 매일 대용량 S3 객체(예: 100GB)가 생성되는 경우, 단일 파일 수집을 피하고 여러 개의 작은 객체로 파티셔닝하고, Parquet 형식으로 저장 및 압축하며, 스키마 감지를 위해 Athena/Glue를 사용하십시오. 일반적인 함정으로는 불충분한 모니터링 일정, Model Monitor에 대한 적절한 기준선을 생성하지 않는 것, 그리고 복호화가 필요한 모든 서비스 보안 주체(SageMaker, Glue, Lambda)에 KMS 액세스 권한을 부여하는 것을 잊는 것 등이 있습니다.

실용적인 문제: 사용 사례 시나리오

시나리오: Streamlytic Media는 AWS에서 팟캐스트 분석 플랫폼을 운영합니다. Kinesis Data Streams를 사용하여 사용자 이벤트를 수집하고, 집계된 피처를 S3에 저장하며, 실시간 참여도 예측을 위해 SageMaker에서 모델을 호스팅합니다. 데이터에는 간헐적으로 PII가 포함되며 SSE-KMS 고객 관리형 키로 암호화됩니다.

과제: 10분 단위의 롤링 이벤트 윈도우에 대해 낮은 지연 시간의 예측을 제공하고, 모델 훈련 전에 PII를 수정하며, SageMaker가 암호화된 S3 데이터를 읽을 수 있도록 보장하고, 피처 드리프트에 대한 지속적인 모니터링을 구현해야 합니다.

권장 접근 방식:

  1. 이벤트를 수집하기 위해 Kinesis Data Stream을 생성하고, Kinesis Data Analytics (Flink)를 실행하여 10분 단위의 롤링 윈도우를 유지하며, 집계된 피처를 시간별 파티션이 적용된 Parquet 형식으로 S3에 내보냅니다.
  2. PII 탐지를 위해 Amazon Macie를 사용하고, 결정론적 수정/토큰화를 적용하기 위해 SageMaker Processing 작업(또는 AWS Glue 작업)을 사용합니다. 결과는 훈련을 위해 Feature Store 오프라인 스토어에 저장합니다.
  3. SageMaker 실행 역할에 CMK에 대한 kms:Decryptkms:GenerateDataKey 권한을 부여하고, 해당 역할을 CMK 키 정책에 추가하며, S3 버킷 정책이나 VPC 엔드포인트가 SageMaker의 액세스를 허용하는지 확인합니다.
  4. 모델을 ml.inf1 인스턴스에 SageMaker 실시간 엔드포인트로 배포하고, DataCaptureConfig를 활성화하며, 훈련 데이터로부터 Model Monitor 기준선을 생성하고, CloudWatch로 알림을 보내는 지속적인 모니터링을 구성합니다.

근거: Kinesis + Flink를 사용한 스트리밍 집계는 이벤트 볼륨과 지연 시간을 최소화합니다. 처리 시점에 PII를 수정하여 개인 정보 보호 및 규정 준수를 유지합니다. 명시적인 KMS 권한은 액세스 실패를 방지합니다. Inferentia 기반 엔드포인트와 Model Monitor는 낮은 추론 비용과 운영 가시성 사이의 균형을 맞춥니다.


훈련 · 모든 도메인 · 보안

이 문제 연습하기 → · ExamRoll.io에서 시간 제한 연습 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

시험 합격하기 →

Amazon 찾아보기 →

Related guides

올인원 액세스

하나의 구독. 모든 시험.

모든 플랜은 무제한 답변 검색, 모의고사, AI 해설, 전체 자료 라이브러리를 20개 이상의 언어로 잠금 해제합니다.

월간
24.87
Just €0.83/day
모든 포함:
  • 무제한 답변 검색
  • 무제한 모의고사
  • AI 기반 해설
  • 전체 자료 라이브러리
  • 20개 이상의 언어
  • 주간 콘텐츠 업데이트
  • 보상 및 추천
  • 우선 지원
무료 체험 시작

신용카드 필요 없음*

최고의 가치
12개월
179.87
Just €0.49/daySave 40%
모든 포함:
  • 무제한 답변 검색
  • 무제한 모의고사
  • AI 기반 해설
  • 전체 자료 라이브러리
  • 20개 이상의 언어
  • 주간 콘텐츠 업데이트
  • 보상 및 추천
  • 우선 지원
무료 체험 시작

신용카드 필요 없음*

✓ 무료 플랜 포함 · ✓ 언제든지 취소 가능 · ✓ 모든 플랜은 전체 제품을 잠금 해제합니다