RetailVision에는 240개의 매장별 개인화 모델(각각 약 120MB)이 있으며, 이 모델들은 자주 쿼리되지 않습니다(모델당 요청 간격이 몇 분). 현재 각 모델을 별도의 엔드포인트로 호스팅하고 있어 비용이 많이 듭니다. 모델이 처음 요청될 때 허용 가능한 콜드 스타트 지연 시간을 유지하면서 비용을 최소화하기 위해 통합하려고 합니다. 이 시나리오에서 비용을 절감하기 위한 최상의 SageMaker 호스팅 접근 방식은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 모델 아티팩트를 S3에 저장하는 단일 SageMaker multi-model endpoint를 사용합니다. 컨테이너는 요청 시 모델을 메모리에 로드하여 적은 트래픽의 여러 모델을 더 적은 인스턴스에 통합합니다. 이 때 인스턴스 메모리가 동시에 활성화되는 모델에 충분한지 확인하고 가끔 발생하는 모델 로드 지연 시간을 허용합니다..
이것이 정답인 이유
정답은 S3에 모델 아티팩트를 저장하는 단일 SageMaker multi-model endpoint를 사용하는 것입니다. 이 접근 방식은 여러 모델을 단일 인스턴스에 통합하여 비용을 크게 절감합니다. 모델은 요청 시 메모리에 로드되므로 자주 쿼리되지 않는 모델에 적합하며, 허용 가능한 콜드 스타트 지연 시간을 유지합니다. 인스턴스 메모리가 동시에 활성화되는 모델에 충분한지 확인하는 것이 중요합니다. 다른 옵션들은 다음과 같은 이유로 최적이 아닙니다. EC2 인스턴스에 사용자 지정 Flask 서버를 사용하는 것은 SageMaker의 관리형 서비스 이점을 잃고, 240개 모델을 모두 메모리에 로드하는 것은 비효율적이며 비용이 많이 들 수 있습니다. 240개의 multi-container real-time endpoint를 사용하는 것은 여전히 각 모델에 대한 별도의 엔드포인트 오버헤드를 발생시켜 비용이 많이 듭니다. SageMaker Asynchronous Inference는 배치 추론에 더 적합하며, 실시간 추론 시 콜드 스타트 지연 시간을 피하기 위해 최소 동시성 1로 구성하는 것은 비용 효율적이지 않습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음