Amazon MLS-C01: MLOps, Monitoreo, Etiquetado y Gobernanza de Modelos — Guía de estudio

Forma parte de la AWS Machine Learning Specialty MLS-C01 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Amazon, o realiza tests cronometrados en ExamRoll.io.

Pipelines, CI/CD y Automatización

El ML a nivel de producción requiere una automatización de extremo a extremo que vincule la ingesta de datos, la validación, el entrenamiento, el ajuste, el empaquetado del modelo y el despliegue en pipelines repetibles. Utilice Amazon SageMaker Pipelines para definir pasos para trabajos de procesamiento (Processing jobs con Data Wrangler o ScriptProcessor), entrenamiento (Training con entrenamiento gestionado con Distributed Data Parallel o XGBoost/BlazingText), ajuste de hiperparámetros (Hyperparameter Tuning con HyperparameterTuningJob con una métrica objetivo y una StoppingCondition para el trabajo de entrenamiento) y el registro de modelos (Registering models) en el SageMaker Model Registry. Integre Pipelines con AWS CodePipeline y CodeBuild para realizar verificaciones de CI a nivel de código y pruebas unitarias, y utilice CloudFormation o CDK para aprovisionar entornos consistentes. Configure el almacenamiento en caché en los pasos para evitar volver a ejecutar trabajo que no ha cambiado, y parametrice las entradas del pipeline (prefijos de S3, tipos de instancia). Para HPO, no dependa únicamente de MaxNumberOfTrainingJobs; establezca también una StoppingCondition por cada trabajo de entrenamiento (MaxRuntimeInSeconds) y habilite la detención temprana automatizada (automated early stopping) donde esté disponible para evitar costos descontrolados. Las trampas comunes incluyen usar el modo Archivo (File mode) para conjuntos de datos en constante crecimiento (cambie al modo Tubería (Pipe mode) o al entrenamiento distribuido para conjuntos de datos grandes), no versionar los conjuntos de datos y las características (features), y no incluir puertas de validación de datos (SageMaker Processing + Deequ o verificaciones de Data Wrangler) antes de reentrenar. Los criterios de decisión entre modelos en la base de datos (Redshift ML) y SageMaker se basan en la complejidad del modelo, la latencia y el control operativo: Redshift ML es conveniente para modelos XGBoost simples dentro de SQL, mientras que SageMaker es necesario para redes profundas (deep nets), arquitecturas personalizadas y endpoints escalables.

Monitoreo, Detección de Deriva y Calidad del Modelo

El monitoreo continuo debe capturar tanto el rendimiento del modelo como la calidad de los datos. Habilite la captura de datos (data capture) de los endpoints del modelo de SageMaker para almacenar solicitudes y respuestas en S3, y luego establezca una línea base (baseline) de la distribución de entrenamiento con un trabajo de línea base de SageMaker Model Monitor. Utilice las verificaciones integradas de Model Monitor para violaciones de esquema y métricas de deriva univariada; para los cambios de distribución, calcule la divergencia KL, el Índice de Estabilidad de la Población (PSI) o las pruebas KS y establezca alarmas de CloudWatch sobre los umbrales de deriva (drift). Realice un seguimiento de las métricas del modelo: para clasificación: precisión/exhaustividad (precision/recall), ROC AUC, matriz de confusión y FPR/FNR específicos de la clase; para regresión: RMSE, MAE y MAPE. Clarify puede ejecutar verificaciones de sesgo (bias) y explicabilidad (explainability) en momentos de preentrenamiento y postentrenamiento y producir atribuciones de características basadas en SHAP; utilice Clarify para detectar disparidades de rendimiento en subgrupos (atributos sensibles). Las trampas operativas comunes incluyen no capturar el contexto de la inferencia (mapeo de características, versión del modelo, ID de la solicitud), ignorar la latencia de las etiquetas (las etiquetas retrasadas rompen la evaluación oportuna) y confundir el cambio de población (population shift) con la deriva de concepto (concept drift); trátelos de manera diferente (reentrenar vs. recopilar etiquetas y reevaluar características). Para las alertas, envíe métricas agregadas e indicadores de deriva a CloudWatch, y automatice la reversión (rollback) o el reentrenamiento a través de SageMaker Pipelines cuando se superan los umbrales.

Etiquetado, Preparación de Datos e Ingeniería de Características

Las etiquetas de calidad y los pipelines de características (features) consistentes son fundamentales. Utilice Amazon SageMaker Ground Truth para crear flujos de trabajo de etiquetado con pre-etiquetado automatizado (etiquetado asistido por modelo), aprendizaje activo (active learning) y consolidación de anotaciones; elija los tipos de trabajadores (fuerza de trabajo privada, proveedor o público) y configure la verificación de etiquetas y métricas para el acuerdo entre anotadores (inter-annotator agreement). Para el EDA y la transformación, ingiera conjuntos de datos en SageMaker Data Wrangler para perfilar distribuciones, imputar valores faltantes y exportar scripts de procesamiento a trabajos de SageMaker Processing. Persista las características (features) online y offline en Amazon SageMaker Feature Store para una recuperación consistente en tiempo de ejecución y para realizar backfills simples. Las decisiones de codificación (encoding) dependen de la escala y la cardinalidad: las variables categóricas de baja cardinalidad pueden codificarse con one-hot encoding; los elementos de alta cardinalidad (p. ej., 100 SKU de productos) usan target encoding o embeddings (capas de embedding de TensorFlow/PyTorch o algoritmos integrados de SageMaker), y las respuestas de encuestas de selección múltiple se mapean a vectores multi-hot. Tenga cuidado con trampas comunes como la fuga de etiquetas (label leakage) al añadir metadatos diarios (incluya ventanas de ingeniería de características y pruebas de fuga), usar el modo Archivo (File mode) para conjuntos de datos de S3 muy grandes (el modo Tubería (Pipe mode) transmite registros y soporta entrenamiento distribuido multi-instancia), y no versionar las transformaciones: exporte las transformaciones de Data Wrangler a pasos reutilizables de Procesamiento/Entrenamiento (Processing/Training) para asegurar la paridad entre el entrenamiento y la inferencia.

Explicabilidad, gobernanza y escalado de equipos de ML

La explicabilidad y la gobernanza necesitan artefactos accionables y pistas de auditoría. Usa SageMaker Clarify para calcular métricas de sesgo previas al entrenamiento y atribuciones de características posteriores al entrenamiento (SHAP) y almacena los resultados con las entradas del Model Registry. Registra los modelos en SageMaker Model Registry con estados de aprobación, ModelPackageGroups firmados y puertas de promoción automatizadas. Realiza un seguimiento de los experimentos y el linaje con SageMaker Experiments y habilita CloudTrail para auditar las llamadas a la API. Para las técnicas de explicabilidad, prefiere la importancia de características nativa del modelo para los modelos de árbol (SHAP integrado de XGBoost) y usa SHAP o gradientes integrados para redes profundas, teniendo en cuenta el costo de tiempo de ejecución: precalcula las explicaciones fuera de línea para los clientes por lotes y expón resúmenes para las solicitudes en tiempo real. Las mejores prácticas de gobernanza incluyen tarjetas de modelo (model cards) con descripciones de conjuntos de datos, comprobaciones de equidad y reglas de negocio documentadas, y la aplicación del mínimo privilegio de IAM para el despliegue de modelos. Para escalar los equipos, modulariza los pipelines, crea plantillas estándar para el preprocesamiento/validación, centraliza el Feature Store y automatiza la detección de deriva (drift) y los disparadores de reentrenamiento para que los científicos de datos se centren en las mejoras en lugar de en las operaciones. Las trampas comunes incluyen depender excesivamente de la importancia de las características para la causalidad, no mantener registros de auditoría para los modelos desplegados y exponer cálculos de explicabilidad costosos de forma síncrona en endpoints de baja latencia.

Problema práctico: escenario de caso de uso

Escenario: Acme Manufacturing opera flotas de sensores remotos con conectividad intermitente y utiliza AWS IoT y S3 para la agregación central. Su entorno de ML en AWS incluye SageMaker, IoT Core, Kinesis Data Streams y dispositivos de borde habilitados para Greengrass.

Desafío: Entregar detección de anomalías de baja latencia en sitios remotos cuando la conectividad es intermitente, mientras se recopila telemetría para el reentrenamiento centralizado y la detección de deriva (drift) sin Direct Connect.

Enfoque recomendado:

  1. Despliega un modelo compacto de detección de anomalías compilado con SageMaker Neo en AWS IoT Greengrass en los dispositivos de borde para inferencia y acciones locales en tiempo real (alarmas locales, almacenamiento en búfer a corto plazo).
  2. Transmite telemetría resumida y marcadores de anomalía a través de AWS IoT Core hacia Amazon Kinesis Data Streams, y usa Kinesis Data Firehose para persistir los datos brutos y agregados en S3 (parquet) para el almacenamiento central.
  3. Construye un SageMaker Pipeline que ingiera lotes de S3, ejecute trabajos de procesamiento (Processing jobs con Data Wrangler) para calcular líneas base e ingeniería de características, dispare HyperparameterTuningJobs según sea necesario y registre los modelos validados en el SageMaker Model Registry.
  4. Habilita SageMaker Model Monitor en el endpoint central y programa trabajos por lotes que comparen las distribuciones recopiladas en el borde con las líneas base de entrenamiento (PSI/KL), y usa SageMaker Ground Truth con alertas muestreadas para el etiquetado humano para cerrar el ciclo.

Justificación: La inferencia en el borde a través de Greengrass + Neo garantiza decisiones de baja latencia con conectividad intermitente; Kinesis + Firehose garantiza una ingesta fiable y ordenada en S3 para el reentrenamiento; SageMaker Pipelines y Model Registry proporcionan reentrenamiento repetible, control de versiones y promoción automatizada con comprobaciones de deriva (drift) para mantener la calidad del modelo.


Seguridad · Todos los dominios

Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Aprueba tu examen →

Explorar Amazon →

Related guides

Acceso todo en uno

Una suscripción. Todos los exámenes.

Cada plan desbloquea la búsqueda ilimitada de respuestas, pruebas de práctica, explicaciones de AI y la biblioteca completa de recursos, en más de 20 idiomas.

Mensual
24.87
Just €0.83/day
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

Mejor valor
12 meses
179.87
Just €0.49/daySave 40%
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

✓ Plan gratuito incluido · ✓ Cancela en cualquier momento · ✓ Todos los planes desbloquean el producto completo