한 전자상거래 회사는 제품 추천을 위해 배포된 SageMaker factorization machines(FM) 엔드포인트를 가지고 있습니다. 팀은 두 가지 새로운 모델(TensorFlow 및 PyTorch)을 훈련했으며, 다음 라우팅 규칙에 따라 A/B 테스트를 실행해야 합니다. 트래픽의 70%는 FM 모델로, 15%는 TensorFlow 모델로, 15%는 PyTorch 모델로 보냅니다. 하지만 유럽 고객의 경우 모든 트래픽을 TensorFlow 모델로 라우팅합니다. 이 동작을 지원하는 아키텍처는 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: TensorFlow 및 PyTorch 모델에 대한 두 개의 프로덕션 변형을 생성하고, SageMaker 엔드포인트 구성에서 각 변형에 대한 원하는 가중치를 설정합니다. 이 구성으로 기존 엔드포인트를 업데이트합니다. 유럽 고객의 경우 요청의 TargetVariant 헤더를 TensorFlow 변형 이름으로 설정합니다..
이것이 정답인 이유
정답은 SageMaker 엔드포인트의 프로덕션 변형 기능을 활용하여 A/B 테스트를 수행하고 조건부 라우팅을 구현하는 것입니다. SageMaker 엔드포인트는 여러 모델 변형을 호스팅하고 각 변형에 트래픽 가중치를 할당할 수 있습니다. TargetVariant 헤더를 사용하면 특정 요청을 특정 변형으로 직접 라우팅할 수 있어 유럽 고객에 대한 요구 사항을 충족합니다.
오답:
Application Load Balancer(ALB) 또는 Network Load Balancer(NLB)를 사용하는 옵션은 SageMaker 엔드포인트 자체의 라우팅 기능을 복제하는 불필요한 복잡성을 추가합니다. 또한, ALB 또는 NLB는 요청 헤더를 기반으로 특정 SageMaker 엔드포인트 변형으로 직접 라우팅하는 기능을 제공하지 않습니다.
자동 스케일링 정책은 트래픽 라우팅과는 직접적인 관련이 없으며, 모델 변형 간의 트래픽 분할을 제어하지 않습니다.