Amazon MLS-C01: Modelado — Supervisado y No Supervisado (ML Clásico) — Guía de estudio

Forma parte de la AWS Machine Learning Specialty MLS-C01 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Amazon, o realiza tests cronometrados en ExamRoll.io.

Elección de modelo y arquitectura para problemas supervisados

La selección de un modelo comienza con la forma de los datos y las restricciones de producción. Para una señal lineal con muchos ejemplos y coeficientes interpretables, la regresión lineal o logística regularizada (SageMaker LinearLearner o ElasticNet de scikit-learn) es rápida y produce coeficientes que se pueden inspeccionar. Cuando dominan las interacciones no lineales, los ensambles de árboles como XGBoost (contenedor XGBoost de SageMaker) o LightGBM capturan la heterogeneidad sin necesidad de un escalado de características intensivo; ajusta eta (learning_rate), max_depth, subsample, colsample_bytree y la regularización alpha/lambda para controlar el sobreajuste (overfitting). Las SVM pueden ser eficaces en conjuntos de características de tamaño pequeño a mediano y bien escalados, pero normalmente requieren contenedores personalizados o el ScriptMode de scikit-learn en SageMaker porque los conjuntos de datos grandes son costosos; recuerda estandarizar las características y elegir el kernel/regularización (C, gamma) con cuidado. Naive Bayes es una línea base (baseline) rápida para entradas categóricas/de texto dispersas y de alta dimensionalidad; asume independencia condicional y falla cuando las correlaciones son fuertes. Para miles de características o conjuntos de datos muy grandes, utiliza la reducción de dimensionalidad (PCA) o feature hashing y prefiere el entrenamiento distribuido en instancias ml.c5 o ml.p3 si usas redes profundas (deep nets) basadas en GPU. Despliega con endpoints de SageMaker para inferencia en tiempo real o con Batch Transform para predicciones masivas; utiliza Multi-Model Endpoints cuando mantengas muchos modelos para reducir costos.

Métricas, desequilibrio, calibración y contrapartidas del despliegue

La exactitud (accuracy) es seductora pero engañosa en problemas desequilibrados; prefiere métricas sensibles a la clase como precisión (precision), exhaustividad (recall), F1, ROC AUC para un énfasis en clases equilibradas, y PR AUC cuando la clase positiva es rara. Al producir probabilidades, comprueba la calibración con diagramas de fiabilidad y la puntuación de Brier (Brier score); utiliza el escalado de Platt (Platt scaling) o la calibración isotónica implementada fuera de línea (offline) (CalibratedClassifierCV de scikit-learn) o calibra dentro del entrenamiento de SageMaker generando puntuaciones brutas y aplicando un paso de post-procesamiento. Para manejar el desequilibrio de clases, prefiere la ponderación de muestras (sample weighting) (soportado en SageMaker LinearLearner y muchos scripts de entrenamiento), el sobremuestreo dirigido (oversampling) (SMOTE) o el submuestreo (undersampling) durante el entrenamiento, y la re-ponderación de la pérdida (loss re-weighting) o focal loss para redes neuronales. Para la puntuación casi en tiempo real de probabilidades de fraude, optimiza la latencia del modelo usando un tipo de instancia con baja latencia de inferencia (ml.m5.large o instancias optimizadas para CPU), mantén los modelos compactos (poda o usa modelos destilados) y utiliza multi-model endpoints o el desvío de tráfico A/B (A/B traffic shifting) a través de los endpoints de SageMaker para desplegar actualizaciones de forma segura. Supervisa la deriva (drift) en producción y la calidad de los datos con SageMaker Model Monitor y automatiza el registro de métricas en CloudWatch.

Ingeniería de características, multicolinealidad y regularización

La multicolinealidad infla la varianza de las estimaciones de los coeficientes en los modelos lineales; detéctala con el factor de inflación de la varianza (VIF) y la correlación de Pearson por pares, y mitígala eliminando características redundantes o usando reducción de dimensionalidad (PCA, SVD). La regularización es un remedio fundamentado: L2 (Ridge) contrae los coeficientes, L1 (Lasso) induce escasez (sparsity) para la selección de características, y ElasticNet combina ambas. Estas están disponibles en scikit-learn y en SageMaker LinearLearner. Para características numéricas fuertemente sesgadas, aplica transformaciones logarítmicas o de Box-Cox para estabilizar la varianza y mejorar el ajuste de los modelos lineales; recuerda que los ensambles de árboles son robustos a las transformaciones monotónicas, mientras que las SVM y las redes neuronales necesitan entradas estandarizadas (StandardScaler) para un entrenamiento estable. Las características categóricas de alta cardinalidad se benefician de la codificación por objetivo (target encoding), los embeddings o el hashing; cuando se utiliza la codificación por objetivo, evita la fuga de datos (leakage) calculando las codificaciones dentro de los pliegues de validación cruzada (cross-validation folds) o usando un conjunto de retención (holdout) separado. Usa SageMaker Feature Store para centralizar y servir transformaciones de características consistentes tanto para el entrenamiento como para la inferencia, y persiste el código de preprocesamiento con paquetes de modelos o imágenes de Docker para que las transformaciones de producción coincidan con las del entrenamiento.

Métodos no supervisados, clustering, detección de anomalías e interpretabilidad

El clustering y la detección de anomalías son herramientas exploratorias y pasos de preprocesamiento para el modelado supervisado. K-means (SageMaker k-means) es rápido, pero asume clústeres esféricos y requiere características escaladas; elija k con puntuaciones de silueta (silhouette scores) o gráficos de codo (elbow plots) con cautela, ya que la inercia puede ser ambigua. Los métodos basados en densidad (DBSCAN) y el clustering jerárquico capturan estructuras no esféricas, pero son computacionalmente más costosos. Para la detección de anomalías a escala, considere SageMaker Random Cut Forest para datos de sensores en streaming y pipelines de Kinesis/Lambda para puntuación casi en tiempo real; ajuste el número de árboles y el tamaño de la muestra para controlar la sensibilidad. Las herramientas de interpretabilidad son críticas: utilice la importancia de características nativa del modelo para modelos de árbol y los valores SHAP (paquete SageMaker Clarify o SHAP) para explicaciones locales y resúmenes de efectos globales. Tenga cuidado con las trampas comunes: la fuga temporal (temporal leakage) al dividir aleatoriamente datos ordenados por tiempo, depender excesivamente de la exactitud (accuracy) en conjuntos de datos desbalanceados y asumir independencia para Naive Bayes. Para el despliegue, empaquete algoritmos personalizados en Docker cuando sea necesario, exponga endpoints de predicción y de estado (health), y orqueste lanzamientos canary mediante la división de tráfico del endpoint.

Problema práctico: FleetSight Logistics — ML exploratorio sobre imágenes de camiones

Escenario: FleetSight recopila ~100 GB/día de imágenes de camiones almacenadas en S3 y utiliza SageMaker Studio para experimentos y SageMaker Ground Truth para el etiquetado de imágenes. Necesitan capacidades de ML ligeras para la detección de defectos con la intención de escalar posteriormente.

Desafío: Identificar casos de uso supervisados/no supervisados factibles y un pipeline de bajo costo para entrenar modelos iniciales con etiquetas limitadas e inferencia casi en tiempo real para alertas.

Enfoque recomendado:

  1. Use SageMaker Ground Truth con aprendizaje activo (active learning) para etiquetar un conjunto de datos inicial; almacene los datos etiquetados en S3 y registre las características en SageMaker Feature Store.
  2. Comience con la detección de anomalías no supervisada utilizando SageMaker Random Cut Forest sobre metadatos de sensores derivados de imágenes y embeddings de imagen simples (extraiga los embeddings con una CNN preentrenada en un SageMaker Notebook usando una GPU ml.p3.2xlarge).
  3. Entrene un clasificador supervisado ligero utilizando aprendizaje por transferencia (transfer learning) (contenedor integrado de TensorFlow o PyTorch en SageMaker) sobre el subconjunto etiquetado; para obtener líneas de base rápidas, extraiga los embeddings y entrene un modelo XGBoost (SageMaker XGBoost) en instancias de CPU.
  4. Despliegue el modelo XGBoost en un endpoint de SageMaker con inferencia asíncrona o en un Multi-Model Endpoint para optimizar costos; monitoree las entradas y predicciones con SageMaker Model Monitor e itere el etiquetado a través de Ground Truth.

Justificación: Utilizar embeddings no supervisados + Random Cut Forest para encontrar anomalías candidatas sin muchas etiquetas, y luego arrancar modelos supervisados mediante aprendizaje por transferencia (transfer learning) y XGBoost para una inferencia compacta y rápida; los servicios de SageMaker proporcionan un flujo de trabajo de desarrollo y monitoreo integrado y escalable.


Análisis Exploratorio de Datos y Visualización · Todos los dominios · Deep Learning y Visión por Computadora

Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Aprueba tu examen →

Explorar Amazon →

Related guides

Acceso todo en uno

Una suscripción. Todos los exámenes.

Cada plan desbloquea la búsqueda ilimitada de respuestas, pruebas de práctica, explicaciones de AI y la biblioteca completa de recursos, en más de 20 idiomas.

Mensual
24.87
Just €0.83/day
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

Mejor valor
12 meses
179.87
Just €0.49/daySave 40%
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

✓ Plan gratuito incluido · ✓ Cancela en cualquier momento · ✓ Todos los planes desbloquean el producto completo