Amazon AIF-C01: AI와 ML의 기본 사항 — 학습 가이드

다음의 일부입니다: AWS AI Practitioner AIF-C01 — 학습 가이드. 검증된 답안으로 연습하기: Amazon 시험 허브, 또는 다음에서 시간 제한 모의고사 풀기: ExamRoll.io.

핵심 개념 및 모델 유형

핵심 용어를 이해하는 것은 견고한 아키텍처 설계와 트레이드오프(trade-off) 결정의 기반이 됩니다. 지도 학습(Supervised learning)은 입력을 레이블이 지정된 출력에 매핑하며, 연속적인 타겟을 위한 회귀(regression)와 이산적인 클래스를 위한 분류(classification)로 나뉩니다. 다중 클래스 분류(20개의 유전자 클래스)와 이진 결정(binary decision)은 모델 선택과 손실 함수(loss function)를 다르게 만듭니다. 비지도 학습(Unsupervised learning)은 레이블이 없는 데이터에서 클러스터링(clustering)과 차원 축소(dimensionality reduction)를 통해 구조를 찾아내며, 이는 세분화(segmentation) 및 이상 탐지(anomaly detection)에 사용됩니다. 일반적인 알고리즘 제품군에는 선형 모델(linear model)과 트리 앙상블(tabular 데이터에 대해 해석 가능하고 빠름), 커널 메서드(kernel method, SVM), 그리고 신경망(neural network, 이미지, 오디오, 텍스트에 대해 유연하고 높은 용량)이 포함됩니다. 이미지 작업의 경우, 합성곱 신경망(convolutional network)이나 사전 훈련된 비전 파운데이션 모델(Amazon SageMaker JumpStart 또는 Amazon Rekognition Custom Labels를 통해 사용)이 주로 사용됩니다. 텍스트의 경우, 트랜스포머(transformer) 아키텍처가 대규모 언어 및 시퀀스 모델의 기반이 됩니다. 해석 가능성 요구사항은 실무자들이 더 간단한 모델이나 SageMaker Clarify와 같은 설명 가능성 도구를 사용하도록 유도합니다. 모델 선택은 예측 성능, 해석 가능성, 추론 지연 시간(inference latency), 비용 간의 균형을 맞추는 과정입니다. 예를 들어, 투명성이 요구되는 유전자 분류에는 트리 기반 모델로 충분할 수 있지만, 고차원의 이미지나 언어 작업에는 딥 모델이 적합합니다. 이러한 알고리즘 제품군을 이해하고, 사전 훈련된 모델을 재사용할 시점과 처음부터 훈련할 시점을 아는 것은 효율적이고 규정을 준수하는 솔루션을 구축하는 데 지침이 됩니다.

ML 수명주기, 데이터 및 피처 관리

머신 러닝 수명주기는 문제 정의, 데이터 수집, 레이블링, 피처 엔지니어링, 훈련, 검증, 배포, 모니터링, 그리고 반복의 과정으로 이루어집니다. AWS 환경에서 SageMaker는 수명주기의 여러 단계를 오케스트레이션합니다. 데이터 변환을 위한 SageMaker Processing, 중앙 집중식 피처 저장 및 온라인/오프라인 서빙을 위한 SageMaker Feature Store, 모델 워크플로의 CI/CD를 위한 SageMaker Pipelines 등이 그 예입니다. 레이블 품질과 클래스 불균형은 흔한 병목 현상입니다. 견고한 주석 파이프라인에 투자하거나, SageMaker Ground Truth를 사용하여 노이즈가 많은 레이블을 줄이고 액티브 러닝(active learning)을 통해 사람의 노력을 집중시키는 것이 좋습니다. 피처 리니지(lineage)와 접근 제어는 재현성 및 거버넌스에 중요합니다. SageMaker Model Registry에 피처와 모델을 등록하고, Amazon S3의 데이터 세트는 수명 주기 정책(lifecycle policy)으로 버전을 관리해야 합니다. 프로덕션 환경에서는 SageMaker Model Monitor를 사용하여 데이터 드리프트(data drift), 컨셉 드리프트(concept drift), 정확도 저하를 탐지하는 자동화된 모델 모니터링을 포함하고, Amazon CloudWatch와 AWS Lambda를 통해 경고를 통합해야 합니다. 파이프라인은 멱등성(idempotency)과 복구 기능을 갖추도록 설계해야 합니다. 이벤트 기반 패턴(S3 이벤트, Step Functions)을 사용하고, 지연 시간 및 처리량 요구사항에 따라 컴퓨팅 및 스토리지가 확장되도록 설계합니다(훈련은 EC2/GPU 또는 Trainium, 추론은 Inf1/Neptune/Graviton 인스턴스 사용).

평가, 알고리즘 및 흔한 함정

평가 지표와 베이스라인을 선택하는 것은 매우 중요한 과정입니다. 분류 문제의 경우 정밀도(precision), 재현율(recall), F1-score, ROC 곡선 아래 면적(AUC)을 고려해야 합니다. 다중 클래스 분류에서는 클래스별 재현율과 macro/micro 평균을 사용합니다. 회귀 평가는 RMSE, MAE, R-squared를 사용합니다. 프로덕션 서빙의 경우, 런타임 효율성은 tail latency(P95/P99)와 처리량(초당 요청 수), 그리고 추론당 비용으로 측정됩니다. 일반적인 함정으로는 불균형 데이터 세트에서 정확도를 선택하는 것, 테스트 데이터에 대한 과도한 하이퍼파라미터 튜닝으로 인한 과적합(overfitting), 비즈니스 결정에 확률을 사용할 때 보정(calibration)을 소홀히 하는 것 등이 있습니다. 교차 검증(cross-validation)과 홀드아웃 검증(holdout validation)을 사용하고, ML이 가치를 더하는지 확인하기 위해 베이스라인 모델(간단한 휴리스틱)을 구현해야 합니다. 레이블이 지정된 데이터가 부족할 때는 전이 학습(transfer learning), 이미지 데이터 증강(data augmentation), 또는 준지도 학습(semi-supervised) 접근 방식을 사용합니다. 설명 가능성과 규정 준수를 위해, 불투명한(opaque) 모델을 사후 설명 도구(post-hoc explainer, 예: SHAP, integrated gradients)와 함께 사용하고 SageMaker Clarify를 통합합니다. AWS에서 흔히 선택하는 알고리즘은 다음과 같습니다: tabular 데이터에는 빠른 SageMaker 훈련을 지원하는 XGBoost, 이미지에는 GPU 인스턴스에서 Torch/TensorFlow를 통한 CNN, 텍스트에는 SageMaker의 Hugging Face를 사용하는 트랜스포머 또는 검색 증강 생성(retrieval-augmented generation)을 위한 Bedrock 파운데이션 모델.

파운데이션 모델, 배포 패턴 및 보안

파운데이션 모델은 개발을 가속화하지만, 독특한 아키텍처 선택과 보안 고려 사항을 야기합니다. Amazon Bedrock은 여러 기본 모델에 대한 관리형 액세스를 제공하며, 미세 조정(fine‑tuning), 검색 증강 생성(RAG) 워크플로, 그리고 시맨틱 검색을 위한 Amazon OpenSearch Service(k-NN) 또는 Amazon Kendra와 같은 벡터 스토어와의 통합을 지원합니다. 데이터 크기와 안전성 요구 사항에 따라 미세 조정, 명령어 조정(instruction‑tuning) 또는 경량 어댑터 중에서 선택합니다. 지연 시간이 짧고 처리량이 높은 추론을 위해서는 Amazon EC2 Inf1(Inferentia)에 최적화된 모델을 배포하거나, SageMaker Neo/Edge Manager를 사용하여 엣지 디바이스에서 모델을 컴파일하고 호스팅하는 것을 고려하십시오. 온디바이스에서 절대적으로 가장 낮은 지연 시간을 요구하는 추론은 SageMaker Edge Manager 또는 AWS IoT Greengrass를 통한 모델 양자화(quantization), 가지치기(pruning), 로컬 런타임이 필요하며, 이는 모델 크기와 정확도를 절충합니다. 보안 패턴에는 VPC 엔드포인트, Bedrock용 AWS PrivateLink, 엄격한 IAM 역할, 민감한 데이터에 대한 KMS 기반 S3 암호화, 감사 로깅이 포함됩니다. 환각(hallucination) 및 프롬프트 공격을 줄이려면 가드레일을 구현하십시오: 입력 새니타이제이션, 프롬프트 템플릿, 응답 필터, RLHF 또는 후처리 검사. CloudTrail로 사용량과 비정상적인 API 호출을 모니터링하고, 모델 액세스 및 데이터 프라이버시를 보호하기 위해 속도 제한 및 이상 탐지를 구현합니다.

실용적인 문제: 사용 사례 시나리오

시나리오: GreenGene Labs는 원시 데이터용 Amazon S3, 모델 개발용 SageMaker, 파운데이션 모델 실험용 Amazon Bedrock을 갖춘 AWS AI 환경을 사용합니다. 이들은 민감한 유전체 및 임상 메타데이터를 엄격한 액세스 제어 하에 유지하며, 연구 대시보드를 위한 확장 가능한 추론이 필요합니다.

과제: 투명한 의사 결정 로직으로 인간 유전자 샘플을 20개 카테고리로 분류하고, 팀 간에 피처 재사용을 유지하며, 연구원을 위해 모니터링되는 저지연 API를 배포합니다.

권장 접근 방식:

  1. SageMaker Processing과 Ground Truth를 사용하여 데이터를 준비하고 레이블을 지정하며, 큐레이션된 피처를 SageMaker Feature Store에 저장합니다.
  2. SageMaker Training에서 해석 가능한 모델(XGBoost, 의사 결정 트리)을 훈련합니다. SageMaker Model Registry에 모델을 등록하고 리니지를 기록합니다.
  3. 최상의 모델을 오토스케일링이 적용된 Application Load Balancer 뒤의 SageMaker 엔드포인트에 배포합니다. 드리프트 감지를 위해 SageMaker Model Monitor를 활성화하고 CloudWatch 경보를 설정합니다.
  4. 더 큰 표현(representation)으로 실험하기 위해, 임베딩용으로 Bedrock 또는 Hugging Face 모델을 사용하고 유사성 검색을 위해 OpenSearch 벡터 인덱스를 추가합니다. 최종 분류를 위해 해석 가능한 모델과 결합합니다.

근거: 중앙 집중식 피처 관리와 재현 가능한 파이프라인은 데이터 유출을 줄이고 협업 속도를 높입니다. 동시에 해석 가능한 모델을 우선시하면 투명성 요구 사항을 충족하고, Bedrock 임베딩은 거버넌스를 희생하지 않으면서도 더 풍부한 표현을 가능하게 합니다.


모든 도메인 · 생성형 AI 개념

이 문제 연습하기 → · ExamRoll.io에서 시간 제한 연습 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

시험 합격하기 →

Amazon 찾아보기 →

Related guides

올인원 액세스

하나의 구독. 모든 시험.

모든 플랜은 무제한 답변 검색, 모의고사, AI 해설, 전체 자료 라이브러리를 20개 이상의 언어로 잠금 해제합니다.

월간
24.87
Just €0.83/day
모든 포함:
  • 무제한 답변 검색
  • 무제한 모의고사
  • AI 기반 해설
  • 전체 자료 라이브러리
  • 20개 이상의 언어
  • 주간 콘텐츠 업데이트
  • 보상 및 추천
  • 우선 지원
무료 체험 시작

신용카드 필요 없음*

최고의 가치
12개월
179.87
Just €0.49/daySave 40%
모든 포함:
  • 무제한 답변 검색
  • 무제한 모의고사
  • AI 기반 해설
  • 전체 자료 라이브러리
  • 20개 이상의 언어
  • 주간 콘텐츠 업데이트
  • 보상 및 추천
  • 우선 지원
무료 체험 시작

신용카드 필요 없음*

✓ 무료 플랜 포함 · ✓ 언제든지 취소 가능 · ✓ 모든 플랜은 전체 제품을 잠금 해제합니다