Amazon MLS-C01: Deep Learning e Visão Computacional — Guia de estudos

Faz parte do AWS Machine Learning Specialty MLS-C01 — Guia de estudos. Pratique com respostas verificadas no centro de exames da Amazon, ou faça testes cronometrados no ExamRoll.io.

Otimização, implantação e monitoramento de inferência para GPU e edge

A otimização da inferência exige a criação de perfis (profiling) de todo o pipeline, não apenas da computação da GPU. A baixa utilização da GPU geralmente é causada por pré-processamento limitado pela CPU, tamanhos de lote (batch sizes) pequenos, latência de endpoint síncrono ou esperas de I/O. Crie perfis com o SageMaker Debugger e as métricas do CloudWatch para identificar gargalos e, em seguida, aplique as soluções: aumente o tamanho do lote ou use inferência assíncrona; converta modelos para TorchScript/ONNX e habilite otimizações do TensorRT em instâncias baseadas em NVIDIA; use precisão mista (AMP/bfloat16) em instâncias p4/p3; compile com o SageMaker Neo para o hardware de destino ou implante o Elastic Inference para anexar aceleração fracionada a instâncias de CPU para uma taxa de transferência (throughput) moderada. Para implantação em edge, use o SageMaker Edge Manager ou o AWS IoT Greengrass com modelos compilados pelo Neo, aplique quantização e poda (pruning) para reduzir o tamanho do modelo e execute o processamento em lote (batching) no dispositivo sempre que possível. Configure endpoints multimodelo do SageMaker ou concorrência provisionada para lidar com cold starts e use políticas de escalonamento automático baseadas na utilização de memória da GPU e na latência das solicitações. Habilite também o Model Monitor para detectar desvio de entrada (input drift) e o SageMaker Model Registry para promoção controlada de modelos; armadilhas comuns incluem compilar modelos com operações (ops) não suportadas pelo Neo ou esquecer de provisionar perfis (roles) do IAM e endpoints de VPC para acesso privado ao S3, o que causa falhas na implantação.

Problema Prático: Cenário de Caso de Uso

Cenário: A QuickServe Corp opera um sistema de ponto de venda on-premise e usa o SageMaker para treinamento e inferência de modelos; imagens das câmeras das lojas são armazenadas em um bucket S3 privado com criptografia KMS. Eles querem um pipeline de produção para detectar o tamanho da fila nos caixas e implantar um modelo leve em dispositivos de edge para alertas em tempo real.

Desafio: Construir e implantar um modelo de contagem de filas preciso e de baixa latência que respeite a segurança dos dados (S3 privado, KMS) e execute em hardware de edge com recursos limitados, ao mesmo tempo que permite um retreinamento seguro com novos dados rotulados.

Abordagem Recomendada:

  1. Treine um detector usando um backbone MobileNetV3 pré-treinado (em um contêiner SageMaker PyTorch) com ajuste fino (fine-tuned) em caixas delimitadoras (bounding boxes) rotuladas com o Ground Truth e armazenadas em um S3 criptografado com KMS; use divisões agrupadas por loja para evitar vazamento de dados (data leakage).
  2. Use aumento de dados (augmentation) (corte aleatório, inversão horizontal, variação de brilho) e a função de perda focal (focal loss) para lidar com o desbalanceamento de classes entre frames com e sem fila; valide com AP50 e recall por classe.
  3. Exporte o modelo para TorchScript/ONNX, compile com o SageMaker Neo visando o dispositivo de edge e implante via AWS IoT Greengrass ou SageMaker Edge Manager com assinatura de modelo e um perfil (role) do IAM que permita apenas os artefatos S3 necessários.
  4. Monitore o desempenho com uploads periódicos em lote para o S3, execute trabalhos (jobs) do SageMaker Processing para detecção de desvio (drift) e retreine no SageMaker usando conjuntos de dados versionados no S3 e o Model Registry com implantação controlada (rollout) para o edge.

Justificativa: Esta abordagem usa aprendizado por transferência (transfer learning) eficiente e compilação específica para o dispositivo para atender aos requisitos de latência e tamanho, impõe segurança via KMS e IAM, e implementa um ciclo de retreinamento monitorado para manter a precisão enquanto previne o vazamento de dados.


Modelagem — Supervisionada e Não Supervisionada (ML Clássico) · Todos os domínios · Processamento de Linguagem Natural e Fala

Pratique estas questões → · Prática cronometrada no ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Passe no seu exame →

Navegar Amazon →

Related guides

Acesso completo

Uma assinatura. Todos os exames.

Todo plano desbloqueia pesquisa ilimitada de respostas, testes práticos, explicações de AI e a biblioteca completa de recursos — em mais de 20 idiomas.

Mensal
24.87
Just €0.83/day
Tudo incluído:
  • Pesquisa ilimitada de respostas
  • Testes práticos ilimitados
  • Explicações com AI
  • Biblioteca completa de recursos
  • Mais de 20 idiomas
  • Atualizações semanais de conteúdo
  • Recompensas e indicações
  • Suporte prioritário
Iniciar teste grátis

*Não é necessário cartão de crédito

Melhor custo-benefício
12 meses
179.87
Just €0.49/daySave 40%
Tudo incluído:
  • Pesquisa ilimitada de respostas
  • Testes práticos ilimitados
  • Explicações com AI
  • Biblioteca completa de recursos
  • Mais de 20 idiomas
  • Atualizações semanais de conteúdo
  • Recompensas e indicações
  • Suporte prioritário
Iniciar teste grátis

*Não é necessário cartão de crédito

✓ Plano gratuito incluído · ✓ Cancele a qualquer momento · ✓ Todos os planos desbloqueiam o produto completo