Amazon AIF-C01: Fundamentos de IA e ML — Guia de estudos

Faz parte do AWS AI Practitioner AIF-C01 — Guia de estudos. Pratique com respostas verificadas no centro de exames da Amazon, ou faça testes cronometrados no ExamRoll.io.

Conceitos Essenciais e Tipos de Modelo

Compreender a terminologia principal é a base para uma arquitetura sólida e decisões de trade-off. O aprendizado supervisionado mapeia entradas para saídas rotuladas e se divide em regressão para alvos contínuos e classificação para classes discretas; a classificação multiclasse (20 classes de genes) versus decisões binárias altera a escolha do modelo e as funções de perda. O aprendizado não supervisionado encontra estruturas em dados não rotulados por meio de clusterização e redução de dimensionalidade para segmentação e detecção de anomalias. As famílias de algoritmos comuns incluem modelos lineares e ensembles de árvores (interpretáveis, rápidos para dados tabulares), métodos de kernel (SVMs) e redes neurais (flexíveis, de alta capacidade para imagens, áudio e texto). Para tarefas de imagem, dominam as redes convolucionais ou modelos de fundação de visão pré-treinados (via Amazon SageMaker JumpStart ou Amazon Rekognition Custom Labels); para texto, as arquiteturas transformer impulsionam os grandes modelos de linguagem e de sequência. Requisitos de interpretabilidade levam os profissionais a usar modelos mais simples ou ferramentas de explicabilidade, como o SageMaker Clarify. A seleção do modelo equilibra o desempenho preditivo, a interpretabilidade, a latência de inferência e o custo: um modelo baseado em árvore pode ser suficiente para a classificação de genes se a transparência for necessária, enquanto modelos profundos se ajustam a tarefas de imagem ou linguagem de alta dimensionalidade. Conhecer essas famílias e saber quando reutilizar modelos pré-treinados em vez de treinar do zero orienta a criação de soluções eficientes e em conformidade.

Ciclo de Vida de ML, Gerenciamento de Dados e Features

O ciclo de vida de machine learning começa com a definição do problema, coleta de dados, rotulagem, engenharia de features, treinamento, validação, implantação, monitoramento e iteração. Em ambientes AWS, o SageMaker orquestra muitas etapas do ciclo de vida: SageMaker Processing para transformações de dados, SageMaker Feature Store para armazenamento centralizado de features e serviço online/offline, e SageMaker Pipelines para CI/CD de fluxos de trabalho de modelos. A qualidade dos rótulos e o balanceamento de classes são gargalos frequentes; invista em pipelines de anotação robustos ou use o SageMaker Ground Truth para reduzir rótulos ruidosos e o aprendizado ativo para focar o esforço humano. A linhagem de features e os controles de acesso são importantes para a reprodutibilidade e a governança; registre features e modelos no SageMaker Model Registry e versione conjuntos de dados no Amazon S3 com políticas de ciclo de vida. Para produção, inclua o monitoramento automatizado de modelos com o SageMaker Model Monitor para detectar desvio de dados, desvio de conceito e degradação da acurácia, e integre alertas via Amazon CloudWatch e AWS Lambda. Arquitete pipelines com idempotência e recuperação: use padrões orientados a eventos (eventos do S3, Step Functions) e projete a computação e o armazenamento para escalar — treinamento em instâncias EC2/GPU ou Trainium, inferência em instâncias Inf1/Neptune/Graviton — com base nos requisitos de latência e throughput.

Avaliação, Algoritmos e Armadilhas Comuns

Selecionar métricas de avaliação e baselines é uma prática decisiva. Para problemas de classificação, considere precisão, recall, F1-score e a área sob a curva ROC; para multiclasse, use o recall por classe e as médias macro/micro. A avaliação de regressão usa RMSE, MAE e R-squared. Para o serviço em produção, a eficiência em tempo de execução é medida pela latência de cauda (P95/P99) e pelo throughput (requisições por segundo), e pelo custo por inferência. Armadilhas típicas incluem escolher a acurácia em conjuntos de dados desbalanceados, overfitting por meio de ajuste excessivo de hiperparâmetros nos dados de teste e negligenciar a calibração quando as probabilidades são usadas para decisões de negócios. Use validação cruzada e validação holdout, e implemente modelos de baseline (heurísticas simples) para garantir que o ML agregue valor. Quando os dados rotulados são escassos, use aprendizado por transferência, aumento de dados para imagens ou abordagens semissupervisionadas. Para explicabilidade e conformidade, combine modelos opacos com explicadores post-hoc (SHAP, gradientes integrados) e integre o SageMaker Clarify. Escolhas comuns de algoritmos na AWS: XGBoost para dados tabulares com treinamento rápido no SageMaker, CNNs para imagens via Torch/TensorFlow em instâncias de GPU e transformers para texto usando Hugging Face no SageMaker ou modelos de fundação do Bedrock para geração aumentada por recuperação.

Modelos de Fundação, Padrões de Implantação e Segurança

Modelos de fundação aceleram o desenvolvimento, mas introduzem escolhas de arquitetura e considerações de segurança distintas. O Amazon Bedrock fornece acesso gerenciado a vários modelos base e suporta fine-tuning, fluxos de trabalho de geração aumentada por recuperação (RAG) e integração com bancos de dados vetoriais, como o Amazon OpenSearch Service (k-NN) ou o Amazon Kendra para busca semântica. Escolha entre fine-tuning, instruction-tuning ou adaptadores leves (lightweight adapters) com base no tamanho dos dados e nas necessidades de segurança. Para inferência de baixa latência e alta vazão (throughput), considere implantar modelos otimizados em instâncias Amazon EC2 Inf1 (Inferentia) ou usar o SageMaker Neo/Edge Manager para compilar e hospedar modelos em dispositivos de borda (edge); a latência mais baixa possível na inferência em dispositivo exige quantização e poda (pruning) do modelo, além de um tempo de execução local via SageMaker Edge Manager ou AWS IoT Greengrass, fazendo uma troca entre o tamanho e a precisão do modelo. Os padrões de segurança incluem endpoints de VPC, AWS PrivateLink para o Bedrock, perfis (roles) do IAM restritos, criptografia no S3 com suporte do KMS para dados sensíveis e logs de auditoria. Para reduzir alucinações e ataques de prompt, implemente guardrails: sanitização de entrada, templates de prompt, filtros de resposta e verificações com RLHF ou de pós-processamento. Monitore o uso e chamadas de API anômalas com o CloudTrail e implemente limites de taxa (rate limits) e detecção de anomalias para proteger o acesso ao modelo e a privacidade dos dados.

Problema Prático: Cenário de Caso de Uso

Cenário: A GreenGene Labs usa um ambiente de IA na AWS com o Amazon S3 para dados brutos, o SageMaker para desenvolvimento de modelos e o Amazon Bedrock para experimentar com modelos de fundação. Eles mantêm metadados genômicos e clínicos sensíveis sob controles de acesso rigorosos e precisam de inferência escalável para dashboards de pesquisa.

Desafio: Classificar amostras de genes humanos em 20 categorias com uma lógica de decisão transparente, manter o reuso de features entre as equipes e implantar uma API monitorada de baixa latência para os pesquisadores.

Abordagem Recomendada:

  1. Use o SageMaker Processing e o Ground Truth para preparar e rotular os dados, armazenando as features curadas no SageMaker Feature Store.
  2. Treine modelos interpretáveis (XGBoost, árvores de decisão) no SageMaker Training; registre os modelos no SageMaker Model Registry e grave a linhagem (lineage).
  3. Implante o melhor modelo em um endpoint do SageMaker atrás de um Application Load Balancer com autoscaling; habilite o SageMaker Model Monitor para detectar desvios (drift) e os alertas do CloudWatch.
  4. Para experimentação com representações maiores, use modelos do Bedrock ou do Hugging Face para embeddings e adicione um índice vetorial no OpenSearch para busca por similaridade; combine com o modelo interpretável para a classificação final.

Justificativa: O gerenciamento centralizado de features e os pipelines reproduzíveis reduzem o vazamento de dados e aceleram a colaboração, enquanto a priorização de modelos interpretáveis satisfaz as necessidades de transparência e os embeddings do Bedrock permitem uma representação mais rica sem sacrificar a governança.


Todos os domínios · Conceitos de IA Generativa

Pratique estas questões → · Prática cronometrada no ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Passe no seu exame →

Navegar Amazon →

Related guides

Acesso completo

Uma assinatura. Todos os exames.

Todo plano desbloqueia pesquisa ilimitada de respostas, testes práticos, explicações de AI e a biblioteca completa de recursos — em mais de 20 idiomas.

Mensal
24.87
Just €0.83/day
Tudo incluído:
  • Pesquisa ilimitada de respostas
  • Testes práticos ilimitados
  • Explicações com AI
  • Biblioteca completa de recursos
  • Mais de 20 idiomas
  • Atualizações semanais de conteúdo
  • Recompensas e indicações
  • Suporte prioritário
Iniciar teste grátis

*Não é necessário cartão de crédito

Melhor custo-benefício
12 meses
179.87
Just €0.49/daySave 40%
Tudo incluído:
  • Pesquisa ilimitada de respostas
  • Testes práticos ilimitados
  • Explicações com AI
  • Biblioteca completa de recursos
  • Mais de 20 idiomas
  • Atualizações semanais de conteúdo
  • Recompensas e indicações
  • Suporte prioritário
Iniciar teste grátis

*Não é necessário cartão de crédito

✓ Plano gratuito incluído · ✓ Cancele a qualquer momento · ✓ Todos os planos desbloqueiam o produto completo