Uma empresa hospeda vários modelos SageMaker em tempo real que exigem instâncias aceleradas e têm diferentes necessidades de escalabilidade. Cold starts devem ser evitados para cada modelo. Qual design atende a essas restrições?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Crie um endpoint SageMaker, adicione um componente de inferência para cada modelo que aponte para esse endpoint, configure o auto scaling por componente de inferência e defina o número mínimo de cópias como pelo menos 1..
Por que esta é a resposta
A opção correta é criar um endpoint SageMaker, adicionar um componente de inferência para cada modelo que aponte para esse endpoint, configurar o auto scaling por componente de inferência e definir o número mínimo de cópias como pelo menos 1. Essa abordagem permite o uso de instâncias aceleradas, pois os componentes de inferência podem ser configurados individualmente. O auto scaling por componente de inferência atende às diferentes necessidades de escalabilidade, e definir o número mínimo de cópias como 1 ou mais evita cold starts, garantindo que sempre haja instâncias prontas para servir as requisições. SageMaker Serverless Inference é uma boa opção para evitar cold starts com concorrência provisionada, mas não suporta instâncias aceleradas. SageMaker Asynchronous Inference é para inferência em lote ou com payloads grandes, não para inferência em tempo real. Um endpoint multi-model com um único auto scaling policy não permite o gerenciamento granular da escalabilidade para cada modelo individualmente, o que é crucial para diferentes necessidades de escalabilidade e para evitar cold starts específicos por modelo.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão