A BrightDrive quer substituir um endpoint de GPU em tempo real de baixo tráfego por um SageMaker Serverless Inference para economizar custos. Eles precisam controlar a concorrência e entender as compensações de latência. Qual afirmação descreve com mais precisão como configurar o serverless e as compensações em comparação com um endpoint em tempo real persistente?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Configure a configuração do Serverless Inference com um MaxConcurrency (por exemplo, 10) e um tamanho de memória apropriado; o serverless escalará a partir do zero, o que pode incorrer em latência de "cold-start" nas primeiras solicitações. O serverless é econômico para tráfego intermitente, mas um endpoint em tempo real persistente oferece latência menor e mais consistente e suporta GPUs e capacidade provisionada..
Por que esta é a resposta
A opção correta descreve com precisão as características do SageMaker Serverless Inference: ele permite configurar MaxConcurrency e tamanho de memória, escala a partir do zero (resultando em "cold starts" iniciais) e é ideal para tráfego intermitente. Também destaca a vantagem de latência mais baixa e consistente de endpoints em tempo real persistentes, que suportam GPUs e capacidade provisionada. As outras opções estão incorretas porque: Serverless Inference não suporta GPUs nem ProvisionedConcurrency. Serverless Inference permite configurar a concorrência, não se limitando a uma única invocação. A mudança para Serverless não garante latência p99 idêntica e "cold starts" podem ocorrer independentemente do MaxConcurrency.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão