Amazon MLS-C01: Análisis Exploratorio de Datos y Visualización — Guía de estudio

Forma parte de la AWS Machine Learning Specialty MLS-C01 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Amazon, o realiza tests cronometrados en ExamRoll.io.

Distribuciones, transformaciones y escalado de características

Comprender las distribuciones de las características en bruto es la base del EDA. Comience por perfilar cada variable con histogramas, estimaciones de densidad de kernel y resúmenes de cuantiles en un notebook de SageMaker Studio o en un trabajo de SageMaker Processing (ml.m5.xlarge con scikit-learn/pandas). Las transformaciones logarítmicas, de Box-Cox, de Yeo-Johnson y las basadas en rangos (transformador de cuantiles) son apropiadas para datos con sesgo a la derecha, pero Box-Cox requiere valores estrictamente positivos y falla con los ceros. Las trampas comunes incluyen aplicar log/Box-Cox sin compensar los ceros y olvidar invertir las transformaciones al interpretar los resultados del modelo. La estandarización (media cero, varianza unitaria) es esencial antes de los métodos basados en distancia (k-means, PCA, SVM) y antes de los modelos lineales regularizados; el escalado Min-Max es útil para redes neuronales con activaciones acotadas. Al desplegar, persista los transformadores en SageMaker Feature Store o como artefactos del modelo para que la inferencia en línea y por lotes utilice un preprocesamiento idéntico. Use AWS Glue o Glue DataBrew para perfilar conjuntos de datos muy grandes en S3 y generar estadísticas de resumen; use Athena para consultar muestras estratificadas. Los criterios de decisión dependen de la sensibilidad del algoritmo: los ensambles de árboles toleran características sin escalar, mientras que los métodos lineales y basados en distancia no. Finalmente, verifique la existencia de valores atípicos y colas pesadas con estadísticas robustas (mediana, IQR) e inspeccione si debe recortar (clip), winsorizar o modelar por separado (segmentación) en lugar de eliminar puntos ciegamente.

Análisis de residuos, curvas de aprendizaje y pruebas de diagnóstico

Los residuos revelan una especificación incorrecta del modelo: se debe diagnosticar una media no nula, heterocedasticidad, autocorrelación o no linealidad. Grafique los residuos frente a los valores predichos y frente a las características clave en SageMaker Studio; calcule el estadístico de Durbin-Watson para la autocorrelación y use la prueba de Ljung-Box para la correlación de residuos en series temporales. Para la regresión, busque formas de embudo que indiquen heterocedasticidad; aplique transformaciones estabilizadoras de la varianza o modelos heterocedásticos (p. ej., XGBoost con un objetivo ajustado o pronóstico probabilístico). Las curvas de aprendizaje —gráficos del error de entrenamiento y validación frente al tamaño del conjunto de entrenamiento— identifican una varianza alta (sobreajuste) o un sesgo alto (subajuste). Use SageMaker Debugger para capturar tensores por época y métricas de CloudWatch, y añada una alarma de CloudWatch que se active si la pérdida de validación diverge mientras la pérdida de entrenamiento disminuye. Las trampas comunes incluyen usar validación cruzada aleatoria para datos temporales (use divisiones basadas en el tiempo) y evaluar con la exactitud (accuracy) en conjuntos desbalanceados (prefiera precisión-exhaustividad o AUC-PR). Para el ajuste de hiperparámetros, base sus decisiones en estos diagnósticos: si la brecha de validación persiste, aumente la regularización, añada datos o reduzca la complejidad del modelo; si ambos errores son altos, aumente la capacidad o añada características. Persista los gráficos y métricas de diagnóstico a través de SageMaker Experiments para la reproducibilidad.

Reducción de dimensionalidad, PCA, autoanálisis y clustering

La reducción de dimensionalidad reduce el ruido y mejora la interpretabilidad. Aplique PCA o SVD aleatorizado (scikit-learn o Spark MLlib en EMR/Glue) después del escalado; inspeccione la ratio de varianza explicada para elegir el número de componentes y examine las cargas (loadings) para mapear los componentes de vuelta a las características originales. Los signos de los autovectores son arbitrarios: interprete las cargas absolutas y agrupe las características por magnitud. Para estructuras altamente no lineales, use t-SNE o UMAP solo para visualización, no como preprocesamiento para modelos sin una validación cruzada cuidadosa. Para el clustering, elija k-means para clústeres esféricos (requiere escalado), Modelos de Mezcla Gaussiana para asignaciones suaves, y DBSCAN para formas basadas en densidad; ejecute las puntuaciones de silueta y el índice de Davies-Bouldin para comparar. En conjuntos de datos grandes, use el k-means integrado de SageMaker (instancias de GPU/CPU) o ejecute mini-batch k-means en SageMaker Processing. Tenga cuidado con la trampa de aplicar PCA a características categóricas con codificación one-hot —considere el feature hashing o las capas de incrustación (embedding layers). Use gráficos de codo, gráficos de varianza explicada y la estabilidad de los clústeres entre submuestras para decidir k. Persista los centroides de los clústeres y los transformadores de PCA en SageMaker Feature Store para que la puntuación en tiempo real y los modelos basados en segmentos posteriores utilicen transformaciones consistentes.

Visualización, Monitorización e Integración con AWS para Deriva y Rendimiento

La visualización es tanto exploratoria como operacional: utilice matplotlib/seaborn en SageMaker Studio para gráficos ad-hoc y Amazon QuickSight para dashboards que rastrean métricas de rendimiento en vivo. Para la deriva del modelo y la calidad de los datos, establezca líneas base con una muestra de entrenamiento representativa a través de SageMaker Model Monitor y SageMaker Clarify para detectar cambios de distribución, cambios en la importancia de las características y sesgos. Configure Model Monitor con una línea base derivada de un artefacto de un trabajo de procesamiento (Processing job) y habilite la monitorización continua en los endpoints desplegados con comprobaciones horarias/diarias; los eventos de CloudWatch y SNS pueden activar alertas. Para la ingesta y el análisis en streaming, utilice Kinesis Data Firehose para persistir JSON en S3 con conversión de formato a Parquet (habilite la conversión de formato de registro y la integración con el Glue Catalog) o adjunte una función Lambda para transformaciones personalizadas. Para consultas SQL casi en tiempo real sobre archivos comprimidos, particione y registre los datos en el Glue Data Catalog y consúltelos con Athena, actualizando las particiones mediante Lambda al llegar un nuevo objeto a S3. Los errores comunes incluyen no versionar las líneas base, ignorar la evolución del esquema (utilice Glue Schema Registry) y depender únicamente de métricas agregadas; incluya siempre la deriva por característica y el rendimiento por segmento para detectar la degradación localizada. Utilice SageMaker Experiments y Model Monitor juntos para correlacionar los cambios en los hiperparámetros con los eventos de deriva y mantener el linaje.

Problema Práctico: Escenario de Caso de Uso

Escenario: La empresa Acme Retailer utiliza el stack de ML de AWS con SageMaker Studio, un data lake en S3, ingesta con Kinesis Firehose, Glue Data Catalog y QuickSight para la visualización. El equipo almacena datos demográficos de clientes, registros de sesión y compras en S3 como JSON y Parquet.

Desafío: Identificar los segmentos de clientes con mayor probabilidad de abandonar (churn) en los próximos seis meses y establecer una monitorización para detectar si las distribuciones de las características o el rendimiento del modelo derivan después del despliegue.

Enfoque Recomendado:

  1. Crear un trabajo de procesamiento (Processing job) de SageMaker (ml.m5.xlarge) para muestrear y perfilar datos usando pandas/sklearn, aplicar transformaciones logarítmicas o de Box-Cox donde sea apropiado, y registrar los artefactos del preprocesamiento en SageMaker Feature Store.
  2. Calcular PCA (scikit-learn o Spark ML en Glue/EMR) después de escalar para reducir la dimensionalidad, examinar la varianza explicada y las cargas (loadings), y realizar clustering con xgboost de SageMaker o el k-means incorporado para derivar segmentos.
  3. Entrenar un modelo de clasificación (XGBoost en SageMaker o una red neuronal pequeña en TensorFlow) usando divisiones de entrenamiento/validación conscientes del tiempo, registrar las métricas en SageMaker Experiments, y configurar la parada temprana (early stopping) y la ponderación de clases (class-weighting) para el desequilibrio.
  4. Desplegar con un SageMaker Endpoint, habilitar Model Monitor usando una línea base generada a partir del trabajo de procesamiento, configurar comprobaciones de deriva horarias y alarmas de CloudWatch para notificar a través de SNS; visualizar el rendimiento y la deriva a nivel de segmento en QuickSight.

Justificación: Este enfoque combina un preprocesamiento robusto, una reducción de dimensionalidad interpretable y un clustering escalable para la segmentación, mientras que SageMaker Model Monitor y QuickSight proporcionan una detección operacional de la deriva de datos y rendimiento, asegurando un preprocesamiento reproducible a través de Feature Store y experimentos rastreados para el análisis de causa raíz.


Ingeniería de Datos e Ingeniería de Características · Todos los dominios · Modelado — Supervisado y No Supervisado (ML Clásico)

Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Aprueba tu examen →

Explorar Amazon →

Related guides

Acceso todo en uno

Una suscripción. Todos los exámenes.

Cada plan desbloquea la búsqueda ilimitada de respuestas, pruebas de práctica, explicaciones de AI y la biblioteca completa de recursos, en más de 20 idiomas.

Mensual
24.87
Just €0.83/day
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

Mejor valor
12 meses
179.87
Just €0.49/daySave 40%
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

✓ Plan gratuito incluido · ✓ Cancela en cualquier momento · ✓ Todos los planes desbloquean el producto completo