AmazonAmazon ML Engineer Associate MLA-C01 Certification·KO·업데이트됨 3 Aug 2026
FinInsights는 지연 시간이 짧은 금융 텍스트 생성을 위해 ml.g5.xlarge 인스턴스에 JumpStart 파운데이션 모델 엔드포인트를 배포했습니다. 성공적인 파일럿 이후, 유사한 지연 시간 테일 동작으로 3배 더 높은 지속 처리량이 필요합니다. 이 요구 사항을 충족하기 위해 SageMaker JumpStart 엔드포인트에 가장 직접적이고 지원되는 변경 사항은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: SageMaker 엔드포인트 구성을 업데이트하여 더 큰 GPU 인스턴스 유형(예: ml.g5.12xlarge)을 사용하거나, 엔드포인트 뒤에 여러 ml.g5.xlarge 인스턴스(인스턴스 수 증가)로 변경하고 엔드포인트 자동 스케일링을 활성화합니다. 동일한 JumpStart 컨테이너 이미지와 새 엔드포인트 구성으로 모델을 재배포합니다..
이것이 정답인 이유
이 옵션은 지연 시간 요구 사항을 유지하면서 처리량을 3배 늘리는 가장 직접적이고 지원되는 방법입니다. 더 큰 GPU 인스턴스 유형(예: ml.g5.12xlarge)을 사용하면 단일 인스턴스의 컴퓨팅 리소스가 증가하여 처리량이 향상됩니다. 여러 ml.g5.xlarge 인스턴스로 확장하고 자동 스케일링을 활성화하면 수요 증가에 따라 엔드포인트가 자동으로 확장되어 처리량 요구 사항을 충족할 수 있습니다. JumpStart 모델은 이미 최적화되어 있으므로 하이퍼파라미터 튜닝은 불필요하며, Elastic Inference는 주로 비용 효율적인 추론에 사용되며 처리량 증가에 적합하지 않습니다. 서버리스 추론은 콜드 스타트 지연 시간으로 인해 짧은 지연 시간 요구 사항을 충족하지 못할 수 있습니다.