Um modelo de ML pontuará clientes em um aplicativo online para determinar qual produto mostrar. O engenheiro precisa minimizar a latência da resposta. Como o modelo deve ser implantado no SageMaker para atender aos requisitos de baixa latência?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Configurar um endpoint de inferência em tempo real..
Por que esta é a resposta
Para minimizar a latência da resposta em um aplicativo online que pontua clientes para determinar qual produto mostrar, a implantação ideal no SageMaker é um endpoint de inferência em tempo real. Este tipo de endpoint é projetado especificamente para inferências de baixa latência, processando uma única solicitação ou um pequeno lote de solicitações imediatamente. A transformação em lote (batch transform) é inadequada, pois é otimizada para processar grandes volumes de dados offline e não para respostas em tempo real. Um endpoint de inferência sem servidor (serverless) pode ser uma opção para baixa latência, mas a opção "em tempo real" é a mais direta e geralmente a primeira escolha para requisitos estritos de latência. A inferência assíncrona é usada para casos onde a latência não é crítica e o processamento pode ser feito em segundo plano, o que não se alinha com a necessidade de minimizar a latência para um aplicativo online interativo.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão