Amazon MLS-C01: Procesamiento de Lenguaje Natural y Habla — Guía de estudio

Forma parte de la AWS Machine Learning Specialty MLS-C01 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Amazon, o realiza tests cronometrados en ExamRoll.io.

Preprocesamiento, tokenización y saneamiento de texto

Un preprocesamiento de texto robusto es la base para pipelines de NLP fiables. Comience por normalizar Unicode, eliminar HTML y remover caracteres de control; utilice AWS Glue o un trabajo de SageMaker Processing (ml.m5.xlarge) para ejecutar pasos de limpieza escalables en Python o PySpark. La elección de la tokenización es un punto de decisión: los tokenizadores de palabras son simples pero sufren de tokens fuera de vocabulario (OOV); los tokenizadores de subpalabras como Byte-Pair Encoding o WordPiece (usado por BERT) reducen el riesgo de OOV y son preferibles para corpus multilingües o con gran cantidad de nombres de productos. Saneé el contenido generado por el usuario eliminando PII, normalizando fechas y números, y mapeando emojis/hashtags a formas canónicas cuando transmiten sentimiento. Tenga cuidado con las trampas comunes: la eliminación agresiva de stopwords puede dañar los modelos de tópicos y los modelos de secuencia, y convertir todo a minúsculas elimina señales de capitalización útiles para el reconocimiento de entidades nombradas. Para producción, implemente un preprocesamiento determinista en una capa de SageMaker Processing o Lambda y registre las versiones del código de preprocesamiento y los artefactos en SageMaker Model Registry para que Model Monitor pueda calcular el desvío de datos (data-drift) contra el mismo pipeline. Cuando se trabaja con millones de comentarios cortos, comprima la salida tokenizada a formato parquet en S3 y use SageMaker Batch Transform para la extracción de características downstream para evitar la latencia de tokenización por solicitud.

Embeddings y representaciones semánticas

Elija los embeddings según la complejidad de la tarea y el presupuesto de cómputo. Para embeddings rápidos y escalables, entrene o use Word2Vec preentrenado a través de BlazingText en SageMaker (use los modos supervisado o skip-gram en instancias ml.c5.4xlarge) para obtener vectores densos para palabras; agréguelos a vectores de oración con un promedio ponderado por IDF para el conteo de tópicos. Para tareas de recuperación semántica y contextuales, realice un ajuste fino (fine-tuning) de modelos transformer (BERT, DistilBERT o Sentence-BERT) usando el framework de Hugging Face en SageMaker Training con instancias de GPU (ml.p3.2xlarge o ml.p4d.24xlarge según la escala) y use inferencia optimizada en ml.g4dn o ml.p3 para endpoints sensibles a la latencia. Produzca y almacene los embeddings en S3 o SageMaker Feature Store; para la búsqueda de vecinos más cercanos aproximada (approximate nearest-neighbor search), use Faiss en un clúster de inferencia dedicado o Amazon Kendra para la búsqueda empresarial. Esté atento a las trampas: usar embeddings estáticos para palabras polisémicas pierde contexto; una dimensionalidad excesiva aumenta el almacenamiento y ralentiza las búsquedas de vecinos más cercanos—aplique PCA/UMAP o cuantización. Cuando los modelos downstream son sensibles al desvío de los embeddings, implemente Model Monitor para rastrear los cambios en la distribución de los embeddings y vuelva a generarlos periódicamente con un tokenizador y un checkpoint de modelo consistentes.

Modelos de secuencia, manejo de intenciones/slots y extracción de entidades

El modelado de secuencias abarca desde los modelos clásicos LSTM/GRU hasta los transformers de tipo encoder-decoder para tareas seq2seq. Para la detección de intenciones y el llenado de slots en sistemas conversacionales, aproveche Amazon Lex para gestionar intenciones, tipos de slot y hooks de cumplimiento (fulfillment); integre Lambda para la validación compleja de slots o el enriquecimiento de contexto. Para modelos a medida, entrene un NER a nivel de token usando campos aleatorios condicionales (conditional random fields) sobre BERT o use el ajuste fino (fine-tuning) de clasificación de tokens de Hugging Face en SageMaker (entrenamiento en GPU con ml.p3.2xlarge). Los casos de uso de secuencia a secuencia (sequence-to-sequence) como la sumarización o la traducción favorecen los transformers encoder-decoder (T5, BART) y requieren instancias de GPU más grandes para el entrenamiento; use precisión mixta (AMP) y acumulación de gradientes para poder procesar secuencias largas. La extracción de entidades puede usar Amazon Comprehend para entidades nombradas listas para usar, pero para entidades específicas del dominio (SKUs de productos, nombres de químicos) elija Comprehend Custom Entities o ajuste finamente su propio modelo de NER. Una trampa común es confundir la clasificación de intenciones con la validación de slots—una alta precisión en la intención no garantiza valores de slot correctos; agregue validación de esquemas, umbrales de confianza e intenciones de respaldo (fallback). Para producción, exponga los modelos a través de endpoints de SageMaker, usando endpoints multimodelo para eficiencia de costos, y utilice inferencia asíncrona o Batch Transform para tareas offline de alto rendimiento.

Voz: transcripción, síntesis y soluciones de voz de extremo a extremo

Las canalizaciones de voz requieren consideraciones tanto del modelo acústico como del modelo de lenguaje. Para la transcripción, Amazon Transcribe maneja casos de uso comunes con características como vocabularios personalizados y filtrado de vocabulario para mejorar el reconocimiento de nombres de marcas o productos; habilite los vocabularios personalizados y el filtrado de vocabulario en la configuración del trabajo de Transcribe, y use la identificación de canal o la diarización de hablantes cuando haya mensajes de voz o registros de múltiples hablantes. Para audio ultracorto con latencia estricta, prefiera Transcribe Streaming en tiempo real con conexiones WebSocket de baja latencia y considere el modelo de lenguaje personalizado de Transcribe para jerga especializada. Para la conversión de texto a voz, Amazon Polly proporciona voces neurales y soporte para SSML; use lexicones y etiquetas SSML para controlar la pronunciación, la prosodia y las pausas para una experiencia de cliente natural. Integre Lex con Transcribe y Polly para construir bots de voz, y conéctese a Amazon Connect para telefonía. Una trampa frecuente es confiar únicamente en los modelos de lenguaje predeterminados para nombres específicos del dominio; siempre agregue vocabularios personalizados o ajuste los modelos. Para necesidades fuera de línea o en las instalaciones (on-premises), empaquete modelos ligeros usando SageMaker Neo o despliegue modelos acústicos más pequeños en dispositivos de borde (edge), mientras centraliza las actualizaciones pesadas del modelo de lenguaje en la nube y las versiona en SageMaker Model Registry.

Problema práctico: Escenario de caso de uso

Escenario: GlobalNews Analytics se ejecuta en AWS con canalizaciones de datos en S3 y preprocesamiento en SageMaker Processing. Ingiere millones de comentarios de usuarios en inglés diariamente y mantiene un punto de conexión (endpoint) de SageMaker para el análisis de temas.

Desafío: Identificar los temas más discutidos a partir de comentarios ruidosos y a menudo cortos, manejando argot, emojis y miles de nombres propios (nombres de productos/lugares).

Enfoque recomendado:

  1. Usar un trabajo de SageMaker Processing (ml.m5.4xlarge) para ejecutar un saneamiento determinista: eliminación de HTML, normalización Unicode, mapeo de emojis a tokens, conversión a minúsculas donde sea apropiado, y almacenar el texto limpio como parquet en S3.
  2. Generar embeddings de frases contextuales ajustando un modelo Sentence-BERT usando Hugging Face en SageMaker Training con ml.p3.2xlarge; persistir los embeddings en S3 y opcionalmente en Feature Store.
  3. Agrupar (clusterizar) los embeddings con Faiss (clúster de CPU o nodos respaldados por GPU) para descubrir grupos de temas y ejecutar un trabajo de SageMaker Processing para calcular los n-gramas principales y las frases representativas por clúster; opcionalmente, refinar los clústeres con UMAP para la reducción de dimensionalidad.
  4. Poner en producción exponiendo un punto de conexión (endpoint) de inferencia ligero (ml.g4dn.xlarge) para la inserción (embedding) de nuevos comentarios, usar Batch Transform para la reagrupación (re-clustering) nocturna, y habilitar SageMaker Model Monitor para detectar la deriva de los embeddings (embedding drift) y desencadenar el reentrenamiento cuando el cambio en la distribución exceda los umbrales.

Justificación: Este enfoque equilibra un preprocesamiento escalable, embeddings contextuales para texto corto/ruidoso y un descubrimiento de temas eficiente basado en similitud, mientras utiliza SageMaker para el entrenamiento, la inferencia y el monitoreo para garantizar la reproducibilidad y la preparación operativa.


Deep Learning y Visión por Computadora · Todos los dominios · Series Temporales y Pronóstico

Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Aprueba tu examen →

Explorar Amazon →

Related guides

Acceso todo en uno

Una suscripción. Todos los exámenes.

Cada plan desbloquea la búsqueda ilimitada de respuestas, pruebas de práctica, explicaciones de AI y la biblioteca completa de recursos, en más de 20 idiomas.

Mensual
24.87
Just €0.83/day
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

Mejor valor
12 meses
179.87
Just €0.49/daySave 40%
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

✓ Plan gratuito incluido · ✓ Cancela en cualquier momento · ✓ Todos los planes desbloquean el producto completo