Um endpoint do SageMaker executando o modelo de Classificação de Imagem integrado em uma instância ml.m5.xlarge está apresentando latência de inferência inaceitável, e ModelLatency é o principal contribuinte. A latência piora quando vários usuários chamam o endpoint simultaneamente. Qual ação reduzirá a latência de inferência para esses pesquisadores?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Anexar um acelerador Amazon Elastic Inference (por exemplo, um ml.eia2.medium) à instância do endpoint..
Por que esta é a resposta
A latência de inferência é um problema comum, especialmente sob carga. Anexar um acelerador Amazon Elastic Inference (EIA) é a solução mais eficaz aqui. Os EIAs fornecem aceleração de inferência de GPU de baixo custo para instâncias de CPU e GPU, otimizando o uso de recursos e reduzindo a latência, especialmente para modelos de aprendizado profundo como classificação de imagem. Mudar para uma instância burstable ml.t3 não é adequado, pois essas instâncias são projetadas para cargas de trabalho de uso baixo a moderado e podem ter desempenho inferior sob carga sustentada, piorando a latência. Habilitar o SageMaker Autopilot é para ajuste de modelo e otimização de hiperparâmetros, não para resolver diretamente a latência de inferência em um endpoint implantado. Alterar para um tipo de instância otimizado para memória não abordará a latência de inferência causada por gargalos de computação, que são típicos em modelos de classificação de imagem.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão