Amazon MLS-C01: Processamento de Linguagem Natural e Fala — Guia de estudos
Faz parte do AWS Machine Learning Specialty MLS-C01 — Guia de estudos. Pratique com respostas verificadas no centro de exames da Amazon, ou faça testes cronometrados no ExamRoll.io.
Pré-processamento, tokenização e higienização de texto
Um pré-processamento de texto robusto é a base para pipelines de NLP confiáveis. Comece normalizando Unicode, removendo HTML e caracteres de controle; use o AWS Glue ou um job do SageMaker Processing (ml.m5.xlarge) para executar etapas de limpeza escaláveis em Python ou PySpark. A escolha da tokenização é um ponto de decisão: tokenizadores de palavras são simples, mas sofrem com tokens fora do vocabulário (OOV); tokenizadores de subpalavras, como Byte-Pair Encoding ou WordPiece (usado pelo BERT), reduzem o risco de OOV e são preferíveis para corpora multilíngues ou com muitos nomes de produtos. Higienize o conteúdo gerado pelo usuário removendo PII, normalizando datas e números e mapeando emojis/hashtags para formas canônicas quando eles transmitem sentimento. Cuidado com as armadilhas comuns: a remoção agressiva de stopwords pode prejudicar modelos de tópicos e modelos de sequência, e a conversão para minúsculas (lowercasing) remove sinais de capitalização úteis para o reconhecimento de entidades nomeadas (named-entity recognition). Para produção, implemente o pré-processamento determinístico em uma camada (layer) do SageMaker Processing ou Lambda e registre as versões do código de pré-processamento e dos artefatos no SageMaker Model Registry para que o Model Monitor possa calcular o desvio de dados (data-drift) em relação ao mesmo pipeline. Ao lidar com milhões de comentários curtos, comprima a saída tokenizada para o formato parquet no S3 e use o SageMaker Batch Transform para a extração de características (feature extraction) downstream, a fim de evitar a latência de tokenização por requisição.
Embeddings e representações semânticas
Escolha os embeddings com base na complexidade da tarefa e no orçamento de computação. Para embeddings rápidos e escaláveis, treine ou use Word2Vec pré-treinado via BlazingText no SageMaker (use os modos supervisionado ou skip-gram em instâncias ml.c5.4xlarge) para obter vetores densos para palavras; agregue em vetores de sentenças com média ponderada por IDF para contagens de tópicos. Para recuperação semântica e tarefas contextuais, faça o ajuste fino (fine-tune) de modelos transformer (BERT, DistilBERT ou Sentence-BERT) usando o framework Hugging Face no SageMaker Training com instâncias de GPU (ml.p3.2xlarge ou ml.p4d.24xlarge, dependendo da escala) e use inferência otimizada em ml.g4dn ou ml.p3 para endpoints sensíveis à latência. Produza e armazene os embeddings no S3 ou no SageMaker Feature Store; para busca aproximada por vizinhos mais próximos (approximate nearest-neighbor search), use o Faiss em um cluster de inferência dedicado ou o Amazon Kendra para busca empresarial. Fique atento às armadilhas: usar embeddings estáticos para palavras polissêmicas perde o contexto; dimensionalidade excessiva aumenta o armazenamento e torna mais lentas as buscas por vizinhos mais próximos — aplique PCA/UMAP ou quantização. Quando os modelos downstream são sensíveis ao desvio dos embeddings (embedding drift), implemente o Model Monitor para rastrear mudanças na distribuição dos embeddings e gere novamente os embeddings periodicamente com um tokenizador e um checkpoint de modelo consistentes.
Modelos de sequência, tratamento de intenções/slots e extração de entidades
A modelagem de sequências abrange desde LSTMs/GRUs clássicos até transformers do tipo encoder-decoder para tarefas seq2seq. Para detecção de intenção (intent detection) e preenchimento de slots (slot filling) em sistemas conversacionais, utilize o Amazon Lex para gerenciar intenções, tipos de slot e hooks de fulfillment; integre com o Lambda para validação complexa de slots ou enriquecimento de contexto. Para modelos personalizados (bespoke), treine um NER a nível de token usando campos aleatórios condicionais (conditional random fields) sobre o BERT ou use o ajuste fino (fine-tuning) de classificação de tokens do Hugging Face no SageMaker (treinamento em GPU com ml.p3.2xlarge). Casos de uso de sequência a sequência (sequence-to-sequence), como sumarização ou tradução, favorecem transformers do tipo encoder-decoder (T5, BART) e exigem instâncias de GPU maiores para o treinamento; use precisão mista (AMP) e acúmulo de gradiente (gradient accumulation) para acomodar sequências longas. A extração de entidades pode usar o Amazon Comprehend para entidades nomeadas prontas para uso (out-of-the-box), mas para entidades específicas do domínio (SKUs de produtos, nomes de compostos químicos), escolha o Comprehend Custom Entities ou faça o ajuste fino do seu próprio modelo de NER. Uma armadilha comum é confundir a classificação de intenção com a validação de slots — uma alta acurácia na intenção não garante valores de slot corretos; adicione validação de esquema, limiares de confiança e intenções de fallback. Para produção, exponha os modelos por meio de endpoints do SageMaker, usando endpoints de múltiplos modelos (multi-model endpoints) para eficiência de custos, e utilize inferência assíncrona ou o Batch Transform para tarefas offline de alto volume (high-throughput).
Voz: transcrição, síntese e soluções de voz de ponta a ponta
Pipelines de voz exigem considerações tanto de modelos acústicos quanto de linguagem. Para transcrição, o Amazon Transcribe lida com casos de uso comuns com recursos como vocabulários personalizados e filtragem de vocabulário para melhorar o reconhecimento de nomes de marcas ou produtos; habilite vocabulários personalizados e filtragem de vocabulário nas configurações do job do Transcribe e use a identificação de canal ou a diarização de locutor quando houver correios de voz ou logs com múltiplos locutores. Para áudio ultracurto com latência rigorosa, prefira o Transcribe Streaming em tempo real com conexões WebSocket de baixa latência e considere o modelo de linguagem personalizado do Transcribe para jargões especializados. Para conversão de texto em fala (text-to-speech), o Amazon Polly oferece vozes neurais e suporte a SSML; use léxicos e tags SSML para controlar a pronúncia, a prosódia e as pausas para uma experiência do cliente natural. Integre o Lex com o Transcribe e o Polly para construir bots de voz e conecte-se ao Amazon Connect para telefonia. Uma armadilha frequente é depender apenas dos modelos de linguagem padrão para nomes específicos do domínio — sempre adicione vocabulários personalizados ou faça o ajuste fino (fine-tune) dos modelos. Para necessidades offline ou on-premises, empacote modelos leves usando o SageMaker Neo ou implante modelos acústicos menores em dispositivos de borda (edge), enquanto centraliza as atualizações pesadas do modelo de linguagem na nuvem e as versiona no SageMaker Model Registry.
Problema Prático: Cenário de Caso de Uso
Cenário: A GlobalNews Analytics, operando na AWS, com pipelines de dados no S3 e pré-processamento no SageMaker Processing. Eles ingerem milhões de comentários de usuários em inglês diariamente e mantêm um endpoint do SageMaker para análise de tópicos.
Desafio: Identificar os tópicos mais discutidos a partir de comentários ruidosos e frequentemente curtos, lidando com gírias, emojis e milhares de nomes próprios (nomes de produtos/lugares).
Abordagem Recomendada:
- Use um job do SageMaker Processing (ml.m5.4xlarge) para executar uma sanitização determinística: remoção de HTML, normalização Unicode, mapeamento de emojis para tokens, conversão para minúsculas quando apropriado e armazene o texto limpo como parquet no S3.
- Gere embeddings de sentenças contextuais fazendo o ajuste fino (fine-tuning) de um modelo Sentence-BERT usando Hugging Face no SageMaker Training com ml.p3.2xlarge; persista os embeddings no S3 e, opcionalmente, no Feature Store.
- Agrupe (clusterize) os embeddings com Faiss (cluster de CPU ou nós com GPU) para descobrir grupos de tópicos e execute um job do SageMaker Processing para calcular os n-grams principais e as sentenças representativas por cluster; opcionalmente, refine os clusters com UMAP para redução de dimensionalidade.
- Coloque em produção expondo um endpoint de inferência leve (ml.g4dn.xlarge) para gerar embeddings de novos comentários, use o Batch Transform para reclusterização noturna e habilite o SageMaker Model Monitor para detectar desvio (drift) nos embeddings e acionar o retreinamento quando a mudança na distribuição exceder os limiares.
Justificativa: Esta abordagem equilibra pré-processamento escalável, embeddings contextuais para texto curto/ruidoso e descoberta eficiente de tópicos baseada em similaridade, ao mesmo tempo que usa o SageMaker para treinamento, inferência e monitoramento para garantir reprodutibilidade e prontidão operacional.
← Deep Learning e Visão Computacional · Todos os domínios · Séries Temporais e Previsão →
Pratique estas questões → · Prática cronometrada no ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Passe no seu exame →