Uma empresa tem um modelo de ML treinado no Amazon SageMaker que deve ser hospedado em produção com alta disponibilidade, latência mínima e a capacidade de lidar com picos imprevisíveis de solicitações. Cada solicitação terá entre 1 KB e 3 MB. A capacidade de inferência deve escalar proporcionalmente com a demanda. Como a empresa deve implantar o modelo?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Crie um endpoint de inferência em tempo real do SageMaker, habilite o auto scaling e implante o modelo existente nesse endpoint..
Por que esta é a resposta
A criação de um endpoint de inferência em tempo real do SageMaker com auto scaling é a solução mais adequada. O SageMaker é projetado para hospedar modelos de ML com alta disponibilidade e baixa latência, e o auto scaling gerencia picos de tráfego automaticamente, garantindo que a capacidade de inferência se ajuste à demanda. As outras opções são menos otimizadas para este cenário: hospedar em um cluster Amazon ECS exigiria mais gerenciamento e o escalonamento agendado não reagiria a picos imprevisíveis; o SageMaker Operator no EKS adiciona complexidade desnecessária para um modelo já treinado no SageMaker; e usar Spot Instances com Spot Fleet pode ser mais barato, mas não garante a baixa latência e a disponibilidade contínua necessárias para inferência em tempo real.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão