Amazon AIF-C01: AI/ML의 비용 최적화 및 요금 책정 — 학습 가이드

다음의 일부입니다: AWS AI Practitioner AIF-C01 — 학습 가이드. 검증된 답안으로 연습하기: Amazon 시험 허브, 또는 다음에서 시간 제한 모의고사 풀기: ExamRoll.io.

Bedrock, SageMaker, EC2 전반의 비용 동인 및 요금 모델

AI/ML 워크로드의 요금은 컴퓨팅, 스토리지, 네트워크 및 서비스별 측정 기준에 따라 나뉩니다. Amazon Bedrock을 통한 파운데이션 모델 액세스는 일반적으로 텍스트 워크로드의 경우 요청당 또는 토큰당, 스트리밍 API의 경우 초당 요금이 부과됩니다. SageMaker는 훈련 및 다중 테넌시 호스팅을 위한 인스턴스 시간과 데이터 전송 및 스토리지에 대해 요금을 청구합니다. EC2 기반 호스팅은 순수 인스턴스 시간 비용에 추가적인 EBS, EFS 또는 FSx 스토리지 요금과 VPC 이그레스 비용이 더해집니다. 주요 비용 동인은 모델 크기(모델이 클수록 토큰/수학 연산 작업과 메모리 사용량이 증가), 추론 처리량(지연 시간에 민감한 동기식 호출은 고가의 GPU에 고정될 때 비용이 더 많이 듦), 그리고 임베딩 조회 및 벡터 검색으로 인해 호출이 배가될 수 있는 검색 증강 생성(RAG)을 위한 데이터 이동입니다. 실무자들이 흔히 빠지는 함정으로는 높은 QPS의 RAG 시스템에서 임베딩 비용을 과소평가하거나, 여러 유휴 SageMaker 엔드포인트를 계속 실행 상태로 두거나, PII를 특정 리전 내에 유지할 때 발생하는 리전 간 이그레스 비용을 무시하는 것 등이 있습니다. 따라서 의사 결정 기준은 요청량, 요청당 지연 시간 허용 범위, 모델을 파인튜닝해야 하는지 아니면 기성 모델을 그대로 사용할 수 있는지, 그리고 관리 및 확장 오버헤드를 고려할 때 공급자가 관리하는 추론(Bedrock/SageMaker 엔드포인트)과 자체 호스팅 EC2/GPU 인스턴스 중 어느 것이 더 나은 TCO를 제공하는지를 고려해야 합니다.

인스턴스 선택, 스팟 인스턴스 및 컴퓨팅 최적화 패턴

인스턴스 선택은 성능과 비용 모두에 영향을 미칩니다. 훈련의 경우, 대규모 행렬 처리량이 필수적일 때는 Trainium(trn1) 또는 GPU 클러스터(p4/p5)를 사용하십시오. 추론의 경우, 비용 절감을 위해 더 작은 모델에는 Inferentia/Inf2(inf1/inf2) 또는 Graviton 기반 CPU 추론을 선호하는 것이 좋습니다. SageMaker Managed Spot Training 및 SageMaker Distributed Training과 같은 관리형 서비스는 체크포인팅을 통합하고 스팟 용량을 자동으로 회수하여 훈련 비용을 대폭 절감합니다. 하지만 스팟은 강력한 폴백(fallback) 전략과 결합하지 않으면 지연 시간이 짧은 프로덕션 환경에서는 함정이 될 수 있습니다. 비용을 절감하는 아키텍처 패턴으로는 비동기식 배치 처리, 콜드 스타트 방지 기능이 있는 오토스케일링, 단일 호스트에 여러 소규모 모델을 통합하는 다중 모델 엔드포인트, 그리고 메모리 및 처리량 요구 사항을 줄이기 위한 혼합 정밀도 및 양자화 사용 등이 있습니다. 대규모 모델 훈련 시 메모리 사용량을 줄이려면 DeepSpeed 또는 ZeRO와 같은 프레임워크를 사용하고, 전체 모델 재훈련을 피하기 위해 파라미터 효율적 파인튜닝(LoRA/어댑터)을 평가하십시오. CPU나 Inferentia 인스턴스가 훨씬 더 나은 가격 대비 성능을 제공할 수 있는 임베딩 중심 워크로드에 최고급 GPU를 사용하는 것은 흔한 실수입니다.

모델 선택의 트레이드오프와 비용 인식 전략

모델 선택은 비용, 지연 시간, 정확성, 데이터 민감도 간의 트레이드오프입니다. Bedrock의 파운데이션 모델은 관리형 확장, 안전 도구, 빠른 반복을 제공하지만, 대규모 환경에서는 호출당 또는 토큰당 비용이 막대해질 수 있습니다. SageMaker나 EC2에서 호스팅되는 오픈 소스 모델은 호스팅 및 운영 오버헤드를 상각할 경우 추론당 비용을 줄일 수 있습니다. 하이브리드 아키텍처가 효과적입니다. 대부분의 요청은 작고 저렴한 모델로 처리하고 복잡한 쿼리는 더 큰 모델로 에스컬레이션하거나, 무거운 컨텍스트는 벡터 스토어(OpenSearch, Amazon QLDB 기반 벡터 DB 또는 서드파티)에서 제공하고 간결한 프롬프트만 LLM에 보내는 검색 증강 생성을 사용할 수 있습니다. 파인튜닝 결정 시에는 데이터 세트 및 컴퓨팅 사용량을 제한하기 위해 파라미터 효율적인 방법(LoRA, 어댑터)과 텍스트-투-텍스트 작업을 위한 JSONL 프롬프트-완성 쌍을 고려해야 합니다. 흔한 함정으로는 프롬프트 엔지니어링을 사용하는 대신 불필요하게 큰 모델을 파인튜닝하거나, 프롬프트 토큰 길이 증가를 간과하거나, 반복성이 높은 쿼리에 대한 응답을 캐싱하거나 중복 제거하지 않는 것 등이 있습니다.

비용 관리를 위한 스토리지, 데이터 지역성, 거버넌스 및 관찰 가능성

스토리지 선택은 월별 비용과 법규 준수 모두에 영향을 미칩니다. 데이터 세트에는 S3 수명 주기 정책, Intelligent-Tiering, 압축 형식(Parquet/TFRecord)을 사용하세요. 활성 훈련 데이터는 처리량이 높은 티어에 배치하고 원시 자산은 Glacier에 아카이빙합니다. PII 및 데이터 상주 요건을 위해 S3 버킷, KMS 키, 컴퓨팅 리소스를 지정된 AWS 리전에 유지하고, VPC 엔드포인트, IAM 정책, 프라이빗 네트워킹을 통해 액세스를 제어하여 의도치 않은 리전 간 데이터 유출(egress)을 방지합니다. RAG를 위한 검색 파이프라인은 전송 비용과 지연 시간을 피하기 위해 벡터 스토어(Amazon OpenSearch Service 또는 EC2/EBS의 임베딩 스토어)를 추론 계층과 동일한 위치에 배치해야 합니다. SageMaker Clarify, Debugger, Model Monitor와 같은 관찰 가능성 및 설명 가능성 도구는 거버넌스와 조기 드리프트 감지를 제공하지만 비용이 추가됩니다. 비용을 제어하려면 샘플링 기반 모니터를 배포하세요. 효율적인 칩(Inferentia/Trainium)을 선택하고 배치를 활용하여 환경 발자국과 요금을 최소화하세요. 흔한 실수는 샘플링 임계값 없이 전체 로깅과 지속적인 모델 모니터링을 활성화하는 것인데, 이는 부가 가치는 거의 없으면서 비용과 노이즈를 모두 증가시킵니다.

실제 문제: 사용 사례 시나리오

시나리오: Acme Retail은 LLM 액세스를 위해 Amazon Bedrock, 모델 훈련/호스팅을 위해 Amazon SageMaker, 데이터 저장을 위해 S3, 제품 인덱싱을 위해 Amazon OpenSearch를 사용하는 AWS AI 스택을 운영하고 있습니다. 이 회사는 일관된 브랜드 목소리를 유지하고, 엄격한 리전 내 PII 요건을 준수하며, 빠듯한 비용 목표를 맞추면서 매일 수천 개의 단락 길이 제품 설명을 생성해야 합니다.

과제: 설명당 비용을 최소화하고 고객 데이터가 지정된 AWS 리전을 절대 벗어나지 않도록 보장하면서, 고품질의 브랜드화된 설명을 대규모로 제공해야 합니다.

권장 접근 방식:

  1. 2계층 추론 파이프라인을 사용합니다. 모든 요청을 먼저 SageMaker 또는 EC2에 로컬로 호스팅된 경량 모델(양자화됨)로 라우팅하여 일반적인 SKU와 간단한 설명을 처리하고, 복잡하거나 신뢰도가 낮은 케이스는 Bedrock 파운데이션 모델로 에스컬레이션합니다.
  2. 임베딩과 검색 인덱스를 리전 내 Amazon OpenSearch에 저장합니다. 간결하게 검색된 컨텍스트를 사용하여 Bedrock 토큰 사용량을 낮게 유지하고, 공통 응답은 ElastiCache에 캐시합니다.
  3. SageMaker Managed Spot Training에서 파라미터 효율적인 방법(LoRA)을 사용하여 작은 특화 모델을 미세 조정하고 S3에 체크포인트를 저장하며, 전체 모델 재훈련은 드물게 수행합니다.
  4. 리전 경계 제어를 강제합니다. S3 버킷과 KMS 키를 리전 내에 두고, Bedrock/SageMaker용 VPC 엔드포인트를 사용하며, 샘플링 기반의 Model Monitor + Clarify를 활용하여 모니터링 비용을 제한합니다.

근거: 저렴한 기준 모델과 선택적 에스컬레이션을 결합하면 설명당 토큰 및 인스턴스 비용을 최소화하고, RAG와 캐싱은 Bedrock 호출을 줄여줍니다. Managed Spot Training과 파라미터 효율적인 미세 조정은 훈련 비용과 스토리지 오버헤드를 낮추고, 리전 내 제어는 PII 및 규정 준수 요건을 충족시킵니다.


MLOps 및 배포 · 모든 도메인

이 문제 연습하기 → · ExamRoll.io에서 시간 제한 연습 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

시험 합격하기 →

Amazon 찾아보기 →

Related guides

올인원 액세스

하나의 구독. 모든 시험.

모든 플랜은 무제한 답변 검색, 모의고사, AI 해설, 전체 자료 라이브러리를 20개 이상의 언어로 잠금 해제합니다.

월간
24.87
Just €0.83/day
모든 포함:
  • 무제한 답변 검색
  • 무제한 모의고사
  • AI 기반 해설
  • 전체 자료 라이브러리
  • 20개 이상의 언어
  • 주간 콘텐츠 업데이트
  • 보상 및 추천
  • 우선 지원
무료 체험 시작

신용카드 필요 없음*

최고의 가치
12개월
179.87
Just €0.49/daySave 40%
모든 포함:
  • 무제한 답변 검색
  • 무제한 모의고사
  • AI 기반 해설
  • 전체 자료 라이브러리
  • 20개 이상의 언어
  • 주간 콘텐츠 업데이트
  • 보상 및 추천
  • 우선 지원
무료 체험 시작

신용카드 필요 없음*

✓ 무료 플랜 포함 · ✓ 언제든지 취소 가능 · ✓ 모든 플랜은 전체 제품을 잠금 해제합니다