A MediLex opera um endpoint em tempo real do SageMaker (instâncias ml.m5.large) para uma API de inferência de NLP. As métricas do CloudWatch relataram uma média de 800 invocações por minuto no último intervalo de pico de 5 minutos e a métrica InvocationsPerInstance é de 100 invocações/minuto. O endpoint atualmente executa 8 instâncias. A equipe de SRE deseja dimensionar corretamente para atender ao mesmo tráfego de pico, mantendo a mesma carga por instância (meta de 150 invocações por instância). Usando o CloudWatch InvocationsPerInstance ou dados de invocação agregados, quantas instâncias eles devem provisionar para atingir a meta de 150 invocações/instância?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: 6 instâncias.
Por que esta é a resposta
A carga total de invocações no pico é de 800 invocações/minuto. Para manter a meta de 150 invocações por instância, o número de instâncias necessárias é calculado dividindo o total de invocações pela meta de invocações por instância: 800 invocações/minuto / 150 invocações/instância = 5,33 instâncias. Como não é possível ter uma fração de instância, o número deve ser arredondado para cima para garantir que a carga seja atendida, resultando em 6 instâncias. 4 instâncias: Seria insuficiente, pois 4 150 = 600 invocações/minuto, abaixo das 800 necessárias. 8 instâncias: Manteria a carga atual de 100 invocações/instância, mas não atingiria a meta de 150 invocações/instância. 10 instâncias: Seria um superprovisionamento, resultando em menos de 80 invocações/instância, o que não atende à meta de 150 invocações/instância.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão