Uma empresa de mídia precisa de recomendações de artigos de baixa latência para leitores em uma cidade. O tráfego atinge picos em horários previsíveis (manhã, almoço, depois do trabalho) e é leve nos demais horários. As respostas de inferência são inferiores a 4 MB. Qual opção de implantação minimiza a latência e é mais econômica?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Inferência serverless com concorrência provisionada para minimizar a latência de cold-start..
Por que esta é a resposta
A inferência serverless com concorrência provisionada é a melhor opção porque oferece baixa latência, escalabilidade automática para lidar com picos de tráfego e é econômica. A concorrência provisionada garante que as funções estejam sempre prontas, eliminando a latência de cold-start, crucial para recomendações em tempo real. O auto scaling lida com a variação previsível do tráfego sem a necessidade de provisionar recursos excessivos. Um endpoint de inferência em tempo real com auto scaling pode ser mais caro, pois você paga por instâncias EC2 mesmo quando o tráfego é baixo. A inferência assíncrona ou trabalhos de transformação em lote não atendem ao requisito de baixa latência para recomendações em tempo real, pois introduzem atrasos inerentes ao processamento em fila ou em lote.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão