AmazonAmazon ML Engineer Associate MLA-C01 Certification·KO·업데이트됨 3 Aug 2026
EduLogic은 프로덕션에 출시하기 전에 답변 정확도와 안전성을 위해 두 가지 Bedrock 모델을 비교하고자 합니다. 대규모로 자동적이고 반복 가능한 지표를 실행하고 엣지 케이스에 대한 사람의 판단을 수집해야 합니다. 내장된 지표를 사용한 자동화된 평가와 샘플링된 출력에 대한 사람의 평가를 모두 가장 잘 구현하는 아키텍처는 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 레이블이 지정된 테스트 세트(입력/참조 쌍이 있는 JSONL)에서 모델을 실행하고 내장된 지표(BLEU/ROUGE/F1, 안전 점수)를 계산하는 Bedrock의 자동화된 평가 작업(또는 Bedrock 평가 API)을 생성합니다. 평가 아티팩트 및 지표 보고서를 S3에 유지합니다. 사람의 평가를 위해 모델 출력의 계층화된 하위 집합을 샘플링하고 사용자 지정 레이블 지정 UI를 사용하여 SageMaker Ground Truth 레이블 지정 작업(또는 Amazon A2I 사용)을 생성하여 사람의 판단을 수집합니다. 최종 모델 선택을 위해 사람의 레이블을 자동 지표와 결합합니다..
이것이 정답인 이유
이 아키텍처는 자동화된 평가와 사람의 평가를 모두 활용하여 Bedrock 모델을 비교하는 가장 효과적인 방법을 제공합니다. Bedrock의 자동화된 평가 작업은 BLEU, ROUGE, F1과 같은 내장된 지표를 사용하여 대규모로 반복 가능한 모델 성능을 측정합니다. S3에 평가 아티팩트를 저장하여 추적 및 분석을 용이하게 합니다. 동시에 SageMaker Ground Truth 또는 Amazon A2I를 사용하여 모델 출력의 샘플링된 하위 집합에 대한 사람의 판단을 수집합니다. 이는 자동화된 지표가 포착하기 어려운 엣지 케이스와 뉘앙스를 평가하는 데 중요합니다. 최종 모델 선택을 위해 사람의 레이블과 자동 지표를 결합하면 포괄적이고 균형 잡힌 평가가 가능합니다. 다른 옵션들은 자동화된 평가 또는 사람의 평가 중 하나를 간과하거나, 효율성이 떨어지거나, 대규모 프로덕션 환경에 적합하지 않습니다.