Amazon MLA-C01: Seguridad, gobernanza y cumplimiento — Guía de estudio

Forma parte de la AWS Machine Learning Engineer Associate MLA-C01 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Amazon, o realiza tests cronometrados en ExamRoll.io.

Roles de IAM, privilegio mínimo y contextos de ejecución de SageMaker

La gestión de identidades y accesos para cargas de trabajo de ML requiere una separación de privilegios explícita y auditable entre usuarios humanos, sistemas de CI/CD y el cómputo en tiempo de ejecución. Para SageMaker, esto significa definir un rol de ejecución dedicado (un rol de IAM con un AssumeRolePolicyDocument que permita a la entidad principal del servicio de SageMaker, sagemaker.amazonaws.com) y limitar los permisos de ese rol al conjunto mínimo de acciones necesarias: S3 GetObject/PutObject en prefijos específicos, kms:Decrypt/kms:Encrypt en una o más CMK administradas por el cliente, logs:CreateLogStream y logs:PutLogEvents para ARN de LogGroup específicos, y sts:AssumeRole solo si se requiere acceso entre cuentas. Adjunte condiciones de política a nivel de recurso (aws:SourceAccount y aws:SourceArn) para que los artefactos creados por un trabajo o pipeline de SageMaker en particular no puedan ser exfiltrados por otras entidades principales. Use roles separados para el entrenamiento, la creación de modelos y el alojamiento (campos RoleArn pasados a CreateTrainingJob, CreateModel, CreateEndpointConfig) para que los privilegios en tiempo de ejecución estén compartimentados; almacene estos ARN de rol en el código o en los pipelines como parámetros en lugar de incrustar credenciales.

Para el acceso efímero de desarrolladores y las aprobaciones humanas, prefiera roles de IAM asumidos a través de AWS STS con credenciales de corta duración en lugar de claves de usuario de IAM de larga duración. La aplicación de revisiones por varias personas y la separación de funciones se logra combinando límites de permisos de IAM, AWS Single Sign-On o un IdP de OIDC, y controles a nivel de recurso en los paquetes de SageMaker Model Registry. Cuando los flujos de trabajo requieran una elevación temporal de privilegios (por ejemplo, para aprobar un paquete de modelo), utilice un flujo de trabajo de aprobación en SageMaker Model Registry que establezca ModelApprovalStatus en “PendingManualApproval” y requiera una entidad principal de IAM con un permiso sagemaker:ApproveModelPackage de alcance restringido para cambiarlo a “Approved”.

Aislamiento de VPC, controles de red y cifrado

El aislamiento de red comienza colocando las instancias de entrenamiento e inferencia de SageMaker dentro de subredes de VPC con una VpcConfig explícita (ID de subred e ID de grupo de seguridad) proporcionada a las API CreateTrainingJob, CreateModel, CreateEndpointConfig y CreateProcessingJob. Combine esto con VPC endpoints (Interface endpoints para com.amazonaws.region.sagemaker y com.amazonaws.region.s3 a través de AWS PrivateLink o Gateway endpoints para S3) para que los artefactos del modelo y el tráfico de la API nunca atraviesen la internet pública. Habilite los VPC Flow Logs para la subred y use reglas de Security Group para restringir el egreso solo a las direcciones y puertos necesarios, por ejemplo, solo al VPC endpoint de S3 o a una NAT Gateway si se permiten descargas de paquetes externos.

El cifrado debe aplicarse en reposo y en tránsito. Para los datos en reposo, utilice el cifrado del lado del servidor de S3 con AWS KMS (SSE-KMS) y proteja las claves con una CMK administrada por el cliente que tenga políticas de clave que restrinjan a los administradores y al rol de ejecución de SageMaker (coloque el ARN de la CMK en OutputDataConfig.KmsKeyId o en las cabeceras SSE-KMS de S3 PutObject para los artefactos). Para los volúmenes de EBS adjuntos a las instancias de entrenamiento, especifique el cifrado del volumen a través de ResourceConfig y asegúrese de que la clave KMS de EBS esté configurada. Para el tráfico de contenedor a contenedor y las transferencias de red, habilite EnableInterContainerTrafficEncryption y EnableNetworkIsolation en CreateTrainingJob/CreateModel para forzar TLS para el tráfico entre contenedores y para bloquear el acceso saliente a internet; además, todas las llamadas REST y SDK a SageMaker y S3 deben aprovechar HTTPS/TLS por defecto. Rote las CMK con EnableKeyRotation en la CMK y audite el uso de las claves con los eventos de KMS de CloudTrail.

Registro de auditoría, eventos de datos y seguimiento del linaje

Una pista de auditoría completa combina los registros del plano de gestión y los eventos del plano de datos. Utilice AWS CloudTrail para registrar todas las llamadas a la API de SageMaker e IAM; habilite el registro de eventos de datos en CloudTrail para los buckets de S3 (PutEventSelectors con DataResources apuntando al ARN de S3) para capturar las lecturas/escrituras a nivel de objeto para los conjuntos de datos de entrenamiento y los artefactos del modelo. Envíe los registros de los contenedores y los registros del sistema de los trabajos de entrenamiento a CloudWatch Logs asegurándose de que los permisos del rol de ejecución para logs:CreateLogStream y logs:PutLogEvents estén presentes; las políticas de retención y los filtros de suscripción pueden transmitir estos registros a un SIEM central. Para la auditoría a nivel de red, habilite los VPC Flow Logs y para la detección de actividad sospechosa, suscríbase a los hallazgos de GuardDuty y a Amazon Macie para el descubrimiento de datos sensibles en S3.

El linaje requiere capturar la procedencia de los artefactos a través del preprocesamiento, el entrenamiento, la evaluación y el despliegue. Utilice SageMaker Pipelines y SageMaker Experiments para crear registros de Experiment, Trial y TrialComponent automáticamente; estas API registran parámetros, entradas, métricas y los metadatos del ModelPackage. Persista los metadatos en un almacén de metadatos central: AWS Glue Data Catalog puede servir como el catálogo de conjuntos de datos y almacenar metadatos a nivel de tabla y particionamiento, mientras que el servicio de metadatos de SageMaker vincula las ejecuciones de los pipelines con los artefactos del modelo. Para la ingesta entre cuentas o de múltiples fuentes, centralice las conexiones con las conexiones de AWS Glue (JDBC para MySQL on-premise) o utilice AWS Database Migration Service (DMS) para replicar datos transaccionales en S3/Redshift donde los crawlers de Glue puedan indexarlos, y luego haga referencia a las tablas de Glue resultantes desde los pipelines para mantener una ruta de linaje auditable.

Gobernanza de modelos: registro, fichas de modelo y monitorización

SageMaker Model Registry (grupos de paquetes de modelos y objetos ModelPackage) proporciona el almacén de modelos central y canónico con estados de ciclo de vida integrados y hooks para CI/CD. Registre un modelo entrenado en un ModelPackageGroup y establezca el ModelApprovalStatus en «PendingManualApproval»; la automatización (CodePipeline, Step Functions) puede pausarse para que una entidad principal autorizada llame a UpdateModelPackage con ModelApprovalStatus=«Approved». Combine el registro con SageMaker Model Cards para documentar el uso previsto, los conjuntos de datos, los hiperparámetros de entrenamiento, las referencias de linaje, las métricas de rendimiento, las métricas de equidad de SageMaker Clarify y las declaraciones de cumplimiento. Las fichas de modelo (Model Cards) deben crearse como metadatos estructurados y almacenarse junto con el ModelPackage para que las revisiones, los registros de auditoría y las fichas de modelo permanezcan ubicados junto con los artefactos binarios.

La monitorización operativa se realiza utilizando SageMaker Model Monitor para la deriva en la calidad de los datos y del modelo, y SageMaker Clarify para el sesgo y la explicabilidad. Habilite DataCaptureConfig en CreateEndpoint para capturar las cargas útiles (payloads) de solicitud y respuesta en un prefijo seguro de S3 (con SSE-KMS), luego configure trabajos de generación de línea base (baseline) de Model Monitor (utilizando estadísticas y restricciones de la línea base) y programe trabajos de monitorización o active análisis bajo demanda. Para la deriva de sesgo en los endpoints en tiempo real desplegados, capture la inferencia y los datos de referencia (ground-truth) (cuando estén disponibles), ejecute trabajos de sesgo de Clarify sobre el conjunto de datos capturado y almacene los informes de Clarify en S3 y en las Model Cards. Las alertas y la remediación pueden vincularse a CloudWatch Alarms y Step Functions que implementen patrones de reversión (rollback) o cuarentena.

Patrones de diseño, contrapartidas y errores comunes

Al centralizar múltiples fuentes de datos, AWS Glue con sus conectores JDBC junto con AWS Lake Formation para un control de acceso de grano fino es el patrón con la menor sobrecarga operativa; usar DMS para replicar fuentes transaccionales en S3 proporciona un mejor aislamiento para las canalizaciones de ML, pero aumenta la complejidad operativa. Para la latencia de acceso al conjunto de datos durante trabajos de entrenamiento repetidos, la entrada de S3 en modo de streaming con el modo Pipe o el montaje de un sistema de archivos compartido como Amazon FSx for Lustre (exportando un espacio de nombres POSIX a las instancias de entrenamiento) reduce el tiempo de inicio en comparación con la copia repetida de grandes conjuntos de datos en volúmenes EBS locales. La contrapartida es que FSx añade coste y gestión; el modo Pipe es más sencillo, pero requiere que su contenedor de entrenamiento soporte la entrada en modo de streaming (RecordIO, protobuf).

Para el desequilibrio de clases y el manejo de variables categóricas con operaciones mínimas, aproveche Data Wrangler o SageMaker Processing para producir transformaciones consistentes y almacenar los datos de características en SageMaker Feature Store, de modo que tanto el entrenamiento offline como la inferencia online compartan la misma transformación. Específicamente para el desequilibrio, prefiera primero soluciones a nivel de algoritmo (para XGBoost, establezca scale_pos_weight en num_negative/num_positive) antes del remuestreo a nivel de datos; los enfoques algorítmicos evitan la creación de registros sintéticos y son operativamente más sencillos para las canalizaciones. Para la detección de anomalías y las comprobaciones de calidad del conjunto de datos, elija entre servicios diseñados para un propósito específico y modelos personalizados: Amazon Lookout for Metrics ofrece detección y visualización automatizadas de anomalías con conectores a múltiples fuentes, mientras que SageMaker Random Cut Forest (integrado) se integra directamente en las canalizaciones y ofrece control total para umbrales personalizados y explicabilidad.

Los errores comunes incluyen roles de IAM demasiado amplios (permisos s3:* o kms:* excesivos), no habilitar los eventos de datos de CloudTrail para S3, lo que conduce a puntos ciegos cuando se exfiltran los artefactos del modelo, no habilitar los endpoints de VPC y, por lo tanto, enrutar datos involuntariamente a través de la red pública de internet, y omitir el flujo de trabajo de aprobación de modelos (Model Approval), lo que resulta en la promoción de modelos sin revisar. Otro error frecuente es almacenar datos sensibles en texto plano en S3 sin SSE-KMS o no restringir las políticas de claves de KMS para impedir el uso de la clave por parte de entidades principales no autorizadas.

Problema práctico: Escenario de caso de uso

AcmeFin: modelo de detección de fraude para una aplicación web financiera. Las fuentes de datos incluyen registros de transacciones y perfiles de clientes en S3, además de tablas MySQL on-premises que contienen las puntuaciones de riesgo de los clientes. Los objetivos son tener canalizaciones (pipelines) seguras y auditables, baja latencia de inicio del entrenamiento para reentrenamientos frecuentes, una puerta de aprobación manual para el despliegue en producción, evaluación de sesgo/deriva bajo demanda para los endpoints desplegados, y detección y visualización automatizadas de anomalías en los datos de entrada.

  1. Ingesta y centralización de datos: usar AWS DMS para replicar la base de datos MySQL on-prem en un prefijo de landing de S3 bajo un cifrado estricto SSE-KMS (política de bucket restringida a las cuentas de AcmeFin). Registrar los conjuntos de datos y particiones de S3 en el AWS Glue Data Catalog mediante los crawlers de Glue y aplicar el acceso a través de los permisos de Lake Formation. Justificación: DMS proporciona replicación continua para tablas transaccionales, y Glue Catalog centraliza los metadatos y permite el linaje a través de ETL y entrenamiento.

  2. Cómputo y almacenamiento seguros: crear roles de ejecución de SageMaker dedicados con el principio de privilegio mínimo (RoleArn usado en CreateTrainingJob) y una política de confianza que permita sagemaker.amazonaws.com; restringir los permisos del rol a prefijos de S3 específicos y a la CMK gestionada por el cliente. Poner todo el entrenamiento y la inferencia en subredes privadas proporcionando VpcConfig.Subnets y VpcConfig.SecurityGroupIds a CreateTrainingJob y CreateEndpointConfig, y crear endpoints de interfaz para com.amazonaws.region.s3 y para la API de SageMaker para evitar la salida a la red pública de internet. Justificación: el aislamiento de VPC junto con los endpoints de VPC garantiza que los artefactos nunca atraviesen redes públicas, y los roles con restricciones de CMK evitan el uso indebido de la clave.

  3. Minimizar la latencia de inicio del entrenamiento: almacenar grandes conjuntos de datos en Amazon FSx for Lustre exportado a la subred de entrenamiento y usar el modo Pipe para entradas de streaming más pequeñas. Configurar CreateTrainingJob con InputDataConfig apuntando al conjunto de datos montado en FSx o a S3 con el modo Pipe, y reutilizar las caches calientes manteniendo constantes los punteros del conjunto de datos entre trabajos. Justificación: FSx proporciona acceso POSIX y evita descargas repetidas de S3; el modo Pipe reduce la latencia de copia para contenedores compatibles con streaming.

  4. Gobernanza y aprobación manual: registrar los modelos en SageMaker Model Registry al finalizar el entrenamiento; establecer ModelApprovalStatus="PendingManualApproval" para los nuevos objetos ModelPackage. Implementar un flujo de trabajo de aprobación usando AWS CodePipeline/Step Functions que requiera que una entidad principal con el permiso sagemaker:UpdateModelPackage llame a UpdateModelPackage(ModelApprovalStatus="Approved") antes de que se ejecute el paso CreateEndpoint. Justificación: Model Registry proporciona estados de ciclo de vida y una acción de aprobación auditable vinculada a las autorizaciones de IAM.

  5. Comprobaciones de sesgo y deriva bajo demanda: habilitar DataCaptureConfig en el endpoint para escribir solicitudes y respuestas en un prefijo de S3 cifrado con SSE-KMS. Para el análisis de sesgo bajo demanda, ejecutar trabajos por lotes de SageMaker Clarify que hagan referencia a los datos capturados y a la línea base de la Model Card; para la deriva continua, programar trabajos de SageMaker Model Monitor que comparen las distribuciones en tiempo real con las estadísticas de la línea base. Justificación: la captura de datos junto con Clarify/Model Monitor proporciona evaluaciones tanto ad-hoc como programadas, con resultados almacenados junto a los metadatos del modelo.

  6. Detección y visualización de anomalías: conectar las métricas capturadas y las series temporales de características a Amazon Lookout for Metrics para la detección automatizada de anomalías y notificaciones, y visualizar los resultados en Amazon QuickSight. Alternativamente, ejecutar un trabajo de entrenamiento de Random Cut Forest en SageMaker y mostrar las anomalías en un dashboard si se necesitan umbrales personalizados. Justificación: Lookout for Metrics reduce la sobrecarga operativa para la detección de anomalías y se integra con múltiples fuentes para una visualización rápida.

Este enfoque equilibra la seguridad (VPC, SSE-KMS, IAM restringido), la gobernanza (Model Registry, Model Cards, flujos de trabajo de aprobación), el entrenamiento de baja latencia (FSx + modo Pipe) y la monitorización operativa (DataCapture, Clarify, Model Monitor, Lookout for Metrics), al tiempo que mantiene un linaje auditable a través de Glue Catalog y SageMaker Experiments.


Monitorización y observabilidad de modelos · Todos los dominios · IA generativa y modelos fundacionales

Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Aprueba tu examen →

Explorar Amazon →

Related guides

Acceso todo en uno

Una suscripción. Todos los exámenes.

Cada plan desbloquea la búsqueda ilimitada de respuestas, pruebas de práctica, explicaciones de AI y la biblioteca completa de recursos, en más de 20 idiomas.

Mensual
24.87
Just €0.83/day
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

Mejor valor
12 meses
179.87
Just €0.49/daySave 40%
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

✓ Plan gratuito incluido · ✓ Cancela en cualquier momento · ✓ Todos los planes desbloquean el producto completo