Amazon AIF-C01: ML 데이터 엔지니어링 — 학습 가이드
다음의 일부입니다: AWS AI Practitioner AIF-C01 — 학습 가이드. 검증된 답안으로 연습하기: Amazon 시험 허브, 또는 다음에서 시간 제한 모의고사 풀기: ExamRoll.io.
데이터 수집, 레이블링, 버전 관리 및 거버넌스
대표성 있고 감사 가능한 데이터 세트를 수집하는 것은 모든 ML의 기본 단계입니다. Amazon S3를 중앙 내구성 스토어로 사용하고, S3 Versioning과 객체 잠금을 활성화하여 원시 입력을 보존하고 출처(provenance)를 기록합니다. 구조화된 수집 및 카탈로그화를 위해 AWS Glue Data Catalog에 데이터 세트를 등록하고 Lake Formation을 사용하여 세분화된 액세스 제어를 적용합니다. 사람이 직접 레이블링해야 하는 경우, Amazon SageMaker Ground Truth는 내장된 워크플로, 주석 UI, 액티브 러닝 루프를 제공하여 레이블링 비용을 절감하는 동시에 레이블러 일치도 및 신뢰도에 대한 메타데이터를 생성합니다. 일반적인 함정으로는 편향되거나 대표성 없는 샘플 수집, 계보(lineage) 및 레이블링 규칙 기록 실패, 불충분한 레이블 품질 검사 등이 있습니다. 레이블링 감사 기록 저장, 일부 데이터에 대한 블라인드 재레이블링, 레이블 통합 휴리스틱 사용 등으로 이러한 문제를 완화할 수 있습니다. 개인 정보 보호 및 규정 준수 관련 결정은 아키텍처를 좌우합니다. KMS 관리형 CMK를 사용한 S3 서버 측 암호화를 사용하고, IAM 정책 및 VPC 엔드포인트(AWS PrivateLink)로 액세스를 제한하며, 모델 훈련을 위해 데이터를 공유하기 전에 Amazon Comprehend로 PII를 탐지하고 수정(redaction)합니다. 장기 실행 프로그램의 경우, 데이터 세트 스냅샷을 캡처하고 데이터 세트 ID로 태그를 지정하며, Amazon SageMaker Experiments나 DVC와 같은 외부 도구로 실험을 추적하여 재현 가능한 훈련 및 규제 보고를 지원합니다.
전처리, 피처 엔지니어링 및 EDA
변환과 피처는 모델의 일반화 능력을 결정합니다. AWS Glue 또는 Amazon SageMaker Data Wrangler를 사용하여 데이터를 프로파일링, 정리, 정규화하고, Amazon QuickSight 또는 Amazon SageMaker Studio에서 호스팅되는 Jupyter 노트북으로 반복적인 탐색적 데이터 분석(EDA)을 수행합니다. 프로덕션 피처 관리를 위해 Amazon SageMaker Feature Store를 도입하여 오프라인 및 온라인 피처 계산의 일관성을 보장하고 훈련/서빙 스큐(train/serve skew)를 방지합니다. 원시 피처와 파생 피처를 별도로 저장하고 피처 생성 로직을 기록합니다. 시계열 및 스트리밍 파이프라인은 Amazon Kinesis 또는 AWS Glue 스트리밍 ETL을 활용하여 짧은 지연 시간으로 피처를 새로 고쳐야 합니다. 일반적인 함정으로는 미래 정보가 훈련 데이터에 유입되는 데이터 유출(data leakage), 결측값의 부적절한 처리, 오프라인 훈련 피처와 온라인 서빙 피처 간의 불일치 등이 있습니다. 파이프라인 설계 시 결정 기준은 최신성 대 비용에 따라 달라집니다. 대규모 과거 데이터 재계산에는 배치 ETL을, 거의 실시간에 가까운 개인화를 위해서는 스트리밍을, 짧은 지연 시간의 온라인 피처가 필요할 때는 하이브리드 아키텍처를 선택합니다. Glue 또는 SageMaker Processing 작업의 일부로 유효성 검사 및 스키마 강제 적용을 자동화하여 스키마 드리프트(schema drift)를 조기에 발견합니다.
임베딩, 증강, 합성 데이터 및 파운데이션 모델용 데이터 세트
임베딩은 텍스트, 이미지 또는 멀티모달 입력을 의미 관계를 포착하는 밀집 벡터로 변환하며, 시맨틱 검색, 검색 증강 생성(RAG), 클러스터링의 기반이 됩니다. Amazon Bedrock 또는 SageMaker에서 호스팅되는 인코더로 임베딩을 생성하고, Amazon OpenSearch Service(k-NN), Amazon Kendra 또는 관리형 벡터 스토어에 벡터를 저장한 다음, 컨텍스트를 검색하여 파운데이션 모델을 조건화하는 검색 증강 생성(RAG) 패턴을 구축합니다. 실제 예제가 부족할 때 데이터 증강 및 합성 데이터 생성이 실용적입니다. SageMaker의 생성 모델을 사용하여 의역(paraphrase) 문장, 이미지 변환(Albumentations 또는 SageMaker Processing 사용), 또는 개인 정보를 보호하는 합성 레코드를 생성합니다. 합성 데이터에 대한 과도한 의존을 주의해야 합니다. 충실도가 낮으면 분포 변화(distribution shift)를 유발하고 모델이 인공적인 요소(artifact)에 과적합될 수 있습니다. FM 훈련 데이터 세트의 경우, 고품질 예시를 선별하고, 프롬프트 템플릿으로 형식을 정규화하며, 모든 데이터 세트 스냅샷을 S3에서 버전 관리합니다. 서드파티 FM과 함께 개인 데이터를 사용하는 경우, 프라이빗 파인튜닝 경로(VPC로 컴퓨팅 리소스 가져오기)를 선호하거나, 소스 문서는 보안 벡터 스토어에 유지하면서 민감하지 않은 컨텍스트만 FM에 전송하는 검색 전용 파이프라인을 배포합니다. 데이터 유출을 방지하기 위해 수정(redaction) 및 토큰 수준 마스킹을 적용합니다. 프롬프트 엔지니어링과 지침 템플릿(시스템 프롬프트)은 모델 응답을 형성하는 데 매우 중요합니다. 필요한 결정성(determinism)과 창의성에 따라 temperature, top_k 또는 top_p를 조정합니다.
평가, 배포, 모니터링 및 수명 주기 관리
평가는 비즈니스 목표에 부합하는 지표를 사용하여 명시적으로 이루어져야 합니다. 회귀 작업에는 RMSE 또는 MAE를 사용하고, 이진 분류는 precision/recall/F1 및 ROC AUC로 평가하며, 요약에는 ROUGE 변형을 사용합니다. 평가 단계에서 검증 및 교차 검증을 수행하고, 최종 승인을 위해 별도의 블라인드 테스트 세트를 확보해야 합니다. 배포는 Amazon SageMaker 엔드포인트(실시간 또는 서버리스 추론) 또는 관리형 FM 서빙을 위한 Amazon Bedrock을 사용합니다. 지연 시간을 최적화하려면 더 작은 증류 모델을 선택하거나, 다중 모델 엔드포인트를 활성화하거나, 예측 불가능한 트래픽에 SageMaker Serverless Inference를 사용합니다. 프로덕션 환경에서는 Amazon SageMaker Model Monitor로 성능 및 데이터 드리프트를 모니터링하고 지표 저하에 대한 경보를 설정합니다. 위험을 제한하기 위해 카나리 또는 블루/그린 배포를 사용합니다. 모델 사용에 대한 액세스 제어는 IAM 역할 정책, 리소스 수준 권한 및 네트워크 격리를 사용하여 시행됩니다. 실무자가 빠지기 쉬운 함정으로는 잘못된 지표 선택(불균형 클래스에 대한 정확도 사용), 개념 드리프트 무시, 감사 가능성을 위한 학습 데이터 및 추론 로그 계측 실패 등이 있습니다. SageMaker Pipelines를 사용하여 ML을 위한 CI/CD를 구현하면 재학습 주기를 표준화하고, 데이터 세트 및 모델 버전 관리를 일관되게 유지하며, 규정 준수를 위한 방어 가능한 감사 추적을 유지할 수 있습니다.
실제 문제: 사용 사례 시나리오
시나리오: 온라인 식료품 체인인 BrightCart는 온프레미스 재고 시스템을 AWS로 현대화하고 있으며, 규정 준수 규칙에 따라 고객 및 재고 데이터를 보호하면서 고객 질문에 답변하고 실시간 재고 위치를 반환하는 생성형 AI 챗봇을 원합니다. 이들의 AWS AI 환경에는 데이터 세트용 S3, 트랜잭션 재고용 Amazon RDS, 개발용 SageMaker Studio, 파운데이션 모델 액세스를 위한 Bedrock, VPC 네트워킹이 포함됩니다.
과제: 현재 재고를 검색하고 민감한 데이터 노출이나 할루시네이션(환각) 발생을 방지하는 프라이빗한 저지연 RAG 지원 챗봇을 구축합니다.
권장 접근 방식:
- 프라이빗 VPC를 프로비저닝하고 Bedrock 및 SageMaker용 AWS PrivateLink 엔드포인트를 구성합니다. 정식 제품 문서와 재고 스냅샷은 서버 측 암호화(KMS)를 사용하여 S3에 저장하고 S3 버전 관리를 활성화합니다.
- 프라이빗 서브넷 내의 Bedrock 인코더 또는 SageMaker 모델을 사용하여 제품 문서에서 지속적으로 임베딩을 계산하고, 빠른 최근접 이웃 검색을 위해 k-NN과 함께 Amazon OpenSearch Service에 벡터를 저장합니다. 실시간 재고는 Amazon RDS에 유지하고 검색을 위한 보안 런타임 커넥터를 제공합니다.
- 애플리케이션이 먼저 OpenSearch에 컨텍스트를 쿼리한 다음, 검색된 컨텍스트와 명시적인 안전 지침이 포함된 시스템 프롬프트 템플릿으로 Bedrock을 호출하는 검색 증강 파이프라인을 구현합니다. 입력 유효성 검사를 통해 사용자 입력을 정제하고, Amazon Comprehend를 사용하여 PII를 탐지하고 검색 전에 수정합니다.
- Application Load Balancer 뒤에 챗봇을 배포하고, VPC 내의 API 게이트웨이를 통해 Bedrock으로 FM을 서빙하며, 제한된 액세스로 CloudWatch에 로깅을 활성화하고, SageMaker Model Monitor와 주기적인 인적 감사를 통해 모델 응답 및 드리프트를 모니터링합니다.
근거: 이 접근 방식은 RAG 패턴을 사용하여 민감한 데이터 노출을 최소화하고, 규정 준수를 위해 프라이빗 네트워킹과 KMS를 활용하며, 정확성을 위해 실시간 재고를 모델 컨텍스트에서 분리하고, 모니터링 및 휴먼 인 더 루프(human-in-the-loop) 검사를 적용하여 할루시네이션을 제어하고 지속적인 안정성을 보장합니다.
← AI 보안 및 개인 정보 보호 · 모든 도메인 · 모델 훈련 →
이 문제 연습하기 → · ExamRoll.io에서 시간 제한 연습 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
시험 합격하기 →