Amazon MLA-C01: Evaluación y selección de modelos — Guía de estudio

Forma parte de la AWS Machine Learning Engineer Associate MLA-C01 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Amazon, o realiza tests cronometrados en ExamRoll.io.

La evaluación precisa de un modelo comienza con la selección de métricas que coincidan con el objetivo de negocio y las características de las clases/etiquetas. Para la clasificación binaria, la matriz de confusión —verdaderos positivos, falsos positivos, falsos negativos, verdaderos negativos— es la primitiva canónica de la cual se derivan la precisión (TP / (TP+FP)), el recall o sensibilidad (TP / (TP+FN)), la especificidad (TN / (TN+FP)) y la exactitud ((TP+TN) / total). La precisión y el recall forman un equilibrio que se captura en la puntuación F1 (2 * precisión * recall / (precisión + recall)), que es la media armónica y enfatiza el balance entre falsos positivos y falsos negativos. Cuando el desequilibrio de clases es severo, la exactitud puede ser engañosa; el área bajo la curva ROC (AUC) mide la separabilidad a través de diferentes umbrales y es robusta al desequilibrio en muchos casos, mientras que el AUC de precisión-recall (AUPRC) es más informativo cuando la prevalencia de la clase positiva es baja. Para la regresión, la raíz del error cuadrático medio (RMSE) penaliza los errores más grandes de forma cuadrática y es sensible a los valores atípicos; utilice el error absoluto medio (MAE) cuando se prefiera la robustez frente a los valores atípicos.

La selección del umbral es una decisión operativa: muchos algoritmos producen una puntuación de probabilidad y requieren un umbral para convertirla en etiquetas de clase. Utilice las curvas ROC y de precisión-recall para localizar umbrales que maximicen un objetivo elegido, como la puntuación F1 o una función de costo ponderada por el negocio. Una metodología práctica es calcular la precisión, el recall y la puntuación F1 para cada umbral a partir de la matriz de confusión y luego elegir el umbral que cumpla con una restricción objetivo de precisión o recall. La validación cruzada complementa esto al reducir la varianza en las estimaciones de las métricas: utilice K-fold estratificado para la clasificación desequilibrada para preservar las proporciones de las clases en todos los pliegues. En el código,

undefined

de scikit-learn con

undefined

y

undefined

más un

undefined

fijo proporciona pliegues reproducibles; registre las métricas por pliegue y agregue las medias y desviaciones estándar para cuantificar la varianza esperada. Al usar SageMaker, puede orquestar ejecuciones de validación cruzada (CV) como trabajos de entrenamiento separados y rastrearlos con las API de SageMaker Experiments:

undefined

,

undefined

,

undefined

, y luego

undefined

y

undefined

para cada pliegue.

El equilibrio sesgo-varianza guía las decisiones sobre la complejidad del modelo y la regularización. Los modelos con alto sesgo (bias) presentan subajuste (underfitting) y producen un error alto tanto en los conjuntos de entrenamiento como en los de validación, mientras que los modelos con alta varianza presentan sobreajuste (overfitting) y tienen un error de entrenamiento bajo pero un error de validación alto. Corrija el sesgo aumentando la capacidad del modelo, añadiendo características informativas o reduciendo la fuerza de la regularización; corrija la varianza añadiendo regularización (L1/L2), reduciendo la complejidad, usando dropout o aumentando los datos de entrenamiento. Utilice las estimaciones de la validación cruzada para detectar la varianza: una gran dispersión en las métricas de los pliegues implica una alta varianza. Para el entrenamiento iterativo en SageMaker, incorpore la detención temprana (para XGBoost, establezca el hiperparámetro

undefined

y

undefined

) y utilice SageMaker Automatic Model Tuning con una estrategia bayesiana para buscar en el

undefined

; configure

undefined

con

undefined

,

undefined

,

undefined

,

undefined

y

undefined

.

Servicios y configuración clave

Los servicios de AWS forman una cadena de herramientas estrechamente integrada para rastrear experimentos, registrar modelos, detectar derivas (drift) y aplicar barreras de protección (guardrails) para el despliegue. Utilice Amazon SageMaker Experiments para organizar las ejecuciones; llame a

undefined

,

undefined

y

undefined

para persistir los hiperparámetros y las métricas. Para la gestión centralizada del ciclo de vida del modelo, utilice SageMaker Model Registry (

undefined

y

undefined

) y controle el flujo de despliegue a través del atributo del paquete de modelo

undefined

, que admite valores como

undefined

,

undefined

y

undefined

. Integre las aprobaciones manuales en un flujo de CI/CD invocando

undefined

para cambiar el

undefined

desde una función de AWS Lambda o una acción de aprobación humana de Step Functions.

Para el monitoreo posterior al despliegue y la detección de sesgo/deriva, utilice SageMaker Model Monitor y SageMaker Clarify. Habilite la captura de datos en tiempo real en un endpoint estableciendo

undefined

en la llamada a

undefined

o

undefined

; especifique

undefined

:

undefined

,

undefined

y

undefined

para recopilar cargas útiles (payloads) representativas. Utilice

undefined

de Model Monitor para generar una línea base (

undefined

) (JSON de

undefined

y

undefined

) a partir de un conjunto de datos de referencia y luego cree un programa de monitoreo con

undefined

, proporcionando un

undefined

, una

undefined

(cron o rate) y

undefined

como

undefined

con

undefined

y

undefined

. Para la equidad y el sesgo, utilice SageMaker Clarify como un

undefined

con los parámetros de

undefined

undefined

y

undefined

, o utilice el builtin de SageMaker Clarify en un trabajo de procesamiento (Processing job) y persista los resultados en S3 para los paneles de control.

Varias capacidades de AWS se utilizan comúnmente en conjunto para la agregación de datos, la preparación de características y la detección de anomalías:

undefined

y

undefined

y para la consistencia de características entre entrenamiento e inferencia.

Patrones de diseño y contrapartidas

Cuando la sobrecarga operativa deba minimizarse, prefiera los servicios administrados y las características de algoritmos integrados en lugar de crear canalizaciones personalizadas de ETL o de monitoreo. Por ejemplo, si se entrena un clasificador binario para la detección de fraudes, XGBoost es una opción integrada y eficiente en SageMaker que ofrece entrenamiento de baja latencia e hiperparámetros adaptados para el desequilibrio, como scale_pos_weight, que debe establecer en (num_negative / num_positive). Configure los hiperparámetros de XGBoost en el Estimator o en el contenedor de entrenamiento: objective=‘binary:logistic’, eval_metric=‘aucpr’ o ‘auc’, y early_stopping_rounds para terminar las ejecuciones con ruido. Esto evita la creación de canalizaciones de sobremuestreo personalizadas (SMOTE), a menos que se requiera un muestreo sintético específico del dominio.

Para la ingeniería de características, utilice SageMaker Data Wrangler para aplicar transformaciones de codificación (one-hot para características categóricas de baja cardinalidad, codificación ordinal/de etiqueta o codificación de destino para características de alta cardinalidad) y luego materialice las características limpias en SageMaker Feature Store o S3. Data Wrangler elimina gran parte de la carga operativa y produce scripts o trabajos de procesamiento que puede reutilizar. Si necesita una selección de modelos automatizada con un esfuerzo mínimo, SageMaker Autopilot puede preprocesar automáticamente características categóricas y numéricas mixtas y generar modelos candidatos; sin embargo, Autopilot abstrae las transformaciones y puede no ser óptimo para regímenes de características personalizados.

La comparación y promoción de modelos es más robusta cuando se registran las métricas, los artefactos y el linaje. Utilice SageMaker Experiments para comparar ejecuciones y, a continuación, cree un ModelPackage en un ModelPackageGroup. Promocione estableciendo ModelPackageApprovalStatus en “Approved” y produzca un EndpointConfig que haga referencia al ARN del paquete de modelo. Cuando se requiera control humano, deje el modelo en “PendingManualApproval” y conecte un flujo de trabajo de aprobación humana utilizando Step Functions o AWS CodePipeline con una acción de aprobación que llame a UpdateModelPackage para moverlo a “Approved”.

Errores comunes y criterios de decisión

Un error común es confundir una caída en la métrica F1 de producción con un fallo del modelo, cuando el problema subyacente es la deriva de datos (data drift). La causa más probable de una caída sostenida del F1 meses después del despliegue es la deriva en la distribución de entrada o la deriva de etiquetas (deriva de concepto), en lugar de un error repentino. Para diagnosticar, habilite DataCaptureConfig en el endpoint para capturar las cargas útiles de solicitud y respuesta en S3, ejecute programaciones de Model Monitor contra las restricciones de la línea base y calcule las estadísticas de distribución de características y el PSI (índice de estabilidad de la población). Ejecute también las comprobaciones de deriva de datos y sesgo de Clarify para detectar cambios que afecten a las métricas de equidad.

Otro error frecuente es manejar incorrectamente el desequilibrio de clases mediante un remuestreo ingenuo sin tener en cuenta la fuga temporal de datos (temporal leakage) o los costos de negocio. Prefiera primero los controles a nivel de algoritmo —para XGBoost, establezca scale_pos_weight y ajuste eval_metric a aucpr o un objetivo personalizado— antes de pasar a estrategias de muestreo que pueden introducir ejemplos duplicados. Para la reproducibilidad y el seguimiento de experimentos, utilice siempre las API de SageMaker Experiments para registrar hiperparámetros y métricas, y registre los paquetes de modelo con los URI de los artefactos y los metadatos de procedencia para que las promociones sean auditables.

Problema práctico: Escenario de caso de uso

Empresa: FinSight Inc. — detección de fraude para transacciones en línea con datos en Amazon S3 y MySQL on-premises, con requisitos de aislamiento seguro de datos, detección y visualización automatizada de anomalías, aprobación manual antes del despliegue a producción, baja latencia de inicio para el entrenamiento iterativo y versionado centralizado de modelos con una sobrecarga operativa mínima.

  1. Agregación y seguridad de datos: Use AWS Glue para rastrear los registros de transacciones de S3 y crear tablas en el Glue Catalog, establezca el cifrado del bucket con SSE-KMS y restrinja el acceso a través de políticas de IAM y VPC endpoints. Para el MySQL on-premises, use una conexión JDBC de AWS Glue dentro de una VPC con una VPN segura o AWS Direct Connect, o use AWS DMS para replicar las tablas requeridas en una zona de aterrizaje (landing zone) de S3. Registre los conjuntos de datos en el Glue Data Catalog y otorgue a los roles de ejecución de SageMaker acceso con el mínimo privilegio.

  2. Preparación de características y detección de anomalías: Use Amazon SageMaker Data Wrangler para conectarse al Glue Catalog y a la zona de aterrizaje de S3, aplique transformaciones (imputación de valores faltantes, codificación de etiquetas para variables categóricas, escalado para las numéricas) y ejecute el perfilado integrado de Data Wrangler para visualizar distribuciones y marcar anomalías. Exporte las características procesadas al almacén offline de SageMaker Feature Store para el entrenamiento y al almacén online para búsquedas de baja latencia en la inferencia.

  3. Entrenamiento del modelo y minimización de la latencia de inicio: Use el Estimator de SageMaker para XGBoost con

undefined

,

undefined

, y establezca

undefined

. Para reducir la latencia de inicio en los trabajos de entrenamiento iterativos, almacene en caché las salidas de Data Wrangler en S3 y reutilice la misma imagen de contenedor de entrenamiento y tipo de instancia en lugar de reconstruir la ingesta de datos cada vez; use SageMaker Pipelines con cache_config habilitado para que los pasos repetidos con entradas/hiperparámetros sin cambios omitan el inicio de la infraestructura.

  1. Seguimiento de experimentos y selección de modelos: Instrumente cada ejecución de entrenamiento con SageMaker Experiments (

undefined

,

undefined

,

undefined

). Use HyperparameterTuner configurado con

undefined

,

undefined

,

undefined

, max_jobs y max_parallel_jobs para encontrar los mejores hiperparámetros. Compare modelos en Experiments y registre los candidatos elegidos en el SageMaker Model Registry creando un ModelPackage en un ModelPackageGroup.

  1. Aprobación manual y control del despliegue: Deje los paquetes de modelo recién creados en

undefined

. Use un flujo de trabajo de AWS Step Functions con una tarea de aprobación humana o una acción de aprobación de AWS CodePipeline; una vez aprobado, ejecute

undefined

para establecer la aprobación en ‘Approved’ y desencadenar la creación automática de un EndpointConfig y la ejecución de

undefined

para realizar el despliegue.

  1. Monitoreo, sesgo y deriva: Habilite DataCaptureConfig en el endpoint en tiempo real con CaptureOptions para Input y Output, DestinationS3Uri y SamplingPercentage. Genere estadísticas de línea base con

undefined

de Model Monitor a partir del conjunto de datos de entrenamiento y programe un monitoreo continuo con

undefined

. Ejecute SageMaker Clarify como un trabajo de procesamiento regularmente para calcular métricas de sesgo y deriva de datos. Si el F1 cae por debajo de las restricciones de la línea base, use las alertas de Model Monitor para desencadenar una pipeline de reentrenamiento automatizada (SageMaker Pipeline) que registre nuevas ejecuciones en Experiments y produzca nuevos paquetes de modelo para revisión humana.

Justificación de AWS: Este enfoque utiliza las capacidades gestionadas de SageMaker —Data Wrangler y Feature Store para minimizar la sobrecarga de preprocesamiento, XGBoost con scale_pos_weight para manejar el desequilibrio sin un remuestreo complejo, SageMaker Experiments y Model Registry para una gestión auditable del ciclo de vida de los experimentos y modelos, DataCaptureConfig junto con Model Monitor y Clarify para la detección automatizada de la deriva y la equidad, y Step Functions/CodePipeline integrados con Model Registry para proporcionar la puerta de aprobación manual requerida. Estos servicios en conjunto minimizan la carga operativa mientras preservan la seguridad, la trazabilidad y la capacidad de responder a la degradación del modelo.


Entrenamiento de modelos y optimización de hiperparámetros · Todos los dominios · Despliegue e inferencia de modelos

Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Aprueba tu examen →

Explorar Amazon →

Related guides

Acceso todo en uno

Una suscripción. Todos los exámenes.

Cada plan desbloquea la búsqueda ilimitada de respuestas, pruebas de práctica, explicaciones de AI y la biblioteca completa de recursos, en más de 20 idiomas.

Mensual
24.87
Just €0.83/day
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

Mejor valor
12 meses
179.87
Just €0.49/daySave 40%
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

✓ Plan gratuito incluido · ✓ Cancela en cualquier momento · ✓ Todos los planes desbloquean el producto completo