Um endpoint SageMaker de produção em tempo real executando o modelo de detecção de objetos integrado em uma instância P3 mostra baixa utilização da GPU. Qual alteração de implantação fará melhor uso dos recursos de inferência provisionados?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Reimplantar o modelo em uma instância M5 e anexar aceleradores Amazon Elastic Inference..
Por que esta é a resposta
A baixa utilização da GPU em uma instância P3 para inferência em tempo real indica que a instância é superprovisionada para a carga de trabalho. As instâncias P3 são caras e otimizadas para treinamento, não necessariamente para inferência de baixo volume. Anexar aceleradores Amazon Elastic Inference (EI) a uma instância M5 é a solução mais econômica e eficiente. Os aceleradores EI fornecem a quantidade certa de aceleração de GPU para inferência, desacoplando os recursos de GPU dos recursos de CPU e memória da instância M5. Isso permite otimizar o custo e o desempenho. Mudar para um trabalho de transformação em lote em uma instância M5 não é adequado para inferência em tempo real. Mover para uma instância P3dn maior aumentaria ainda mais o custo e o superprovisionamento. Hospedar em um cluster Amazon ECS com P3 ainda manteria o problema de baixa utilização da GPU e alto custo.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão