Amazon AIF-C01: Seguridad y Privacidad de la IA — Guía de estudio
Forma parte de la AWS AI Practitioner AIF-C01 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Amazon, o realiza tests cronometrados en ExamRoll.io.
Protección de datos y control de acceso
La protección de los datos de entrenamiento e inferencia comienza con el acceso de privilegios mínimos. Utilice roles de IAM para Amazon SageMaker, AWS Lambda y Amazon Bedrock con políticas detalladas (fine-grained) y restricciones a nivel de recurso; almacene las credenciales en AWS Secrets Manager y evite incrustar secretos en el código. Clasifique los datos con Amazon Macie y AWS Glue Data Catalog para que solo los conjuntos de datos aprobados (y sus subconjuntos aprobados) ingresen a las canalizaciones (pipelines) de entrenamiento. Para atributos sensibles, aplique la detección y redacción (redaction) o tokenización de PII de Comprehend antes del almacenamiento o la indexación; considere reemplazar la PII con tokens reversibles cuando se requiera la vinculación para flujos de trabajo posteriores (downstream). Aplique políticas de bucket de S3, bloquee el acceso público y exija el cifrado SSE-KMS para los objetos que contengan material sensible. Utilice políticas de claves de KMS y la rotación de claves para controlar quién puede descifrar los artefactos de entrenamiento o los puntos de control (checkpoints) del modelo. Las trampas comunes para los profesionales incluyen conceder roles de ejecución de SageMaker demasiado amplios, olvidar restringir el acceso a los prefijos de S3 y no rotar las claves de KMS o las credenciales de IAM. Los criterios de decisión deben sopesar la sensibilidad de los datos, la capacidad de redactar o sintetizar las entradas y si el acceso directo del modelo a la PII sin procesar es estrictamente necesario. Cuando la PII deba preservarse para la utilidad del modelo, prefiera el procesamiento aislado con pistas de auditoría controladas en lugar del almacenamiento abierto.
Conectividad privada, cifrado y gestión de claves
El aislamiento de red y los controles criptográficos son fundamentales para el ML en producción. Despliegue el entrenamiento y el alojamiento (hosting) de SageMaker dentro de VPC utilizando endpoints de VPC y AWS PrivateLink para que los datos nunca transiten por la red pública de internet. Configure endpoints de interfaz de VPC para S3, Secrets Manager y Bedrock (donde sea compatible) y aplique políticas de endpoint para restringir el tráfico a principales y prefijos aprobados. Cifre todos los datos en tránsito con TLS y en reposo con SSE-KMS (S3) y el cifrado de EBS para las instancias de entrenamiento. Utilice AWS KMS para la gestión centralizada de claves; considere claves multirregionales para la recuperación ante desastres y las operaciones entre regiones, y restrinja los permisos de Decrypt utilizando políticas de claves de KMS. Para cargas de trabajo altamente reguladas, utilice AWS Nitro Enclaves para aislar las operaciones criptográficas y la atestación (attestation) de los artefactos del modelo sin exponer la memoria del host. Las trampas comunes incluyen olvidar bloquear el acceso público de S3 al usar políticas de endpoint, dejar los metadatos de EC2 demasiado permisivos o usar claves de KMS del cliente sin controles de acceso explícitos. Elija el cifrado del lado del cliente si debe evitar el descifrado del lado de AWS, y prefiera SSE-KMS cuando necesite una auditabilidad de acceso detallada (fine-grained) además de la integración con los servicios de AWS.
Registro, auditoría, gobernanza y explicabilidad
Mantenga la observabilidad de extremo a extremo: habilite CloudTrail para la auditoría a nivel de API en SageMaker, Bedrock, KMS y S3; transmita los logs a CloudWatch y a un archivo centralizado e inmutable para su retención y cumplimiento normativo. Utilice AWS Config para registrar las configuraciones de los recursos y detectar desviaciones (drift). Para el linaje y la gobernanza específicos de ML, utilice SageMaker Model Registry y SageMaker Experiments para capturar los metadatos del modelo, el versionado, la procedencia y el historial de despliegue; integre SageMaker Model Monitor para detectar la deriva de concepto (concept drift), el sesgo de datos (data skew) y la degradación de la calidad de la predicción. Para la detección de sesgos y la explicabilidad, instrumente las canalizaciones (pipelines) con SageMaker Clarify para obtener métricas de sesgo del conjunto de datos, SHAP o gradientes integrados para la atribución de características (feature attribution), y produzca tarjetas de modelo (model cards) que documenten los datos de entrenamiento, las métricas de evaluación y las limitaciones conocidas. Las trampas para los profesionales incluyen registrar PII en texto plano en CloudWatch, no correlacionar las versiones del modelo con las métricas de inferencia o carecer de alertas automatizadas sobre las desviaciones (drift). Los criterios de decisión deben equilibrar los períodos de retención con el costo, y exigir que los resultados de la explicabilidad sean legibles por humanos y se almacenen con los metadatos del modelo para la auditabilidad y la revisión por parte de clínicos/reguladores cuando corresponda.
Entrenamiento con preservación de la privacidad, RAG, incrustaciones y consideraciones de seguridad de Bedrock
Cuando los modelos interactúan con corpus de datos sensibles o sirven contenido específico del usuario, aplique técnicas de preservación de la privacidad. Los mecanismos de privacidad diferencial (DP) durante el entrenamiento pueden limitar la contribución individual; los patrones de aprendizaje federado pueden mantener los registros en bruto on-premises mientras se comparten las actualizaciones del modelo. Para la Generación Aumentada por Recuperación (RAG), evite indexar PII en bruto en los almacenes de vectores; preprocese con redacción de PII o almacene punteros y aplique la redacción sobre la marcha en el momento de la recuperación. Las incrustaciones (embeddings) pueden filtrar información sensible; trate los almacenes de vectores como cualquier base de datos: cifre en reposo (S3/EBS), restrinja el acceso mediante IAM y VPC, y considere la posibilidad de tokenizar claves o usar filtros en tiempo de consulta. Bedrock proporciona barreras de protección (guardrails) y herramientas de moderación para detectar y bloquear entradas/salidas dañinas, y se integra con los controles de IAM y VPC; implemente las barreras de protección como una capa de defensa en profundidad, pero no confíe en ellas como el único control. Las trampas comunes incluyen exponer la base de datos de vectores a través de endpoints abiertos, no actualizar los índices de RAG, lo que provoca resultados obsoletos o sesgados, y asumir que el ajuste de prompts elimina las alucinaciones. Elija entre el ajuste fino (fine-tuning) síncrono en Bedrock y la ingeniería de prompts en tiempo de ejecución en función de la latencia, la residencia de los datos y las necesidades de gobernanza del modelo.
Problema práctico: Escenario de caso de uso
Escenario: Horizon Media, un proveedor de streaming, ejecuta una canalización de IA basada en SageMaker además de Amazon Bedrock para las funciones de asistente. Los registros de visualización y los datos de personalización residen en buckets de S3 cifrados en eu‑west‑1 y los metadatos de contenido diario se indexan en un almacén de vectores de OpenSearch para RAG.
Desafío: Necesitan ofrecer recomendaciones personalizadas y un asistente conversacional respaldado por Bedrock, al tiempo que evitan la fuga de PII en las incrustaciones, garantizan el procesamiento de datos vinculado a la región y proporcionan un linaje de modelo auditable y alertas de deriva (drift).
Enfoque recomendado:
- Configure el entrenamiento de SageMaker y el acceso a Bedrock dentro de una VPC usando AWS PrivateLink y endpoints de interfaz de VPC; aplique políticas de endpoint de S3 para restringir los prefijos de los buckets.
- Use Amazon Macie y Comprehend PII para detectar y redactar la PII antes de crear las incrustaciones; almacene solo texto redactado o tokens reversibles en el almacén de vectores, cifrado con SSE-KMS.
- Registre los modelos y artefactos en SageMaker Model Registry y realice el seguimiento de los experimentos con SageMaker Experiments; habilite Model Monitor para la deriva de datos y predicciones (drift) y CloudTrail/CloudWatch para los registros de auditoría.
- Aplique las barreras de protección (guardrails) de Bedrock para la moderación de contenido, aplique políticas de claves de IAM y KMS para la residencia en la región, y considere la privacidad diferencial o los datos sintéticos para entrenar con muestras altamente sensibles.
Justificación: El aislamiento de la red, el control centralizado de claves, la redacción de PII antes de la creación de incrustaciones y un linaje y monitoreo exhaustivos se alinean con las mejores prácticas de los profesionales para minimizar las fugas, cumplir con la residencia de los datos y mantener una gobernanza auditable en los sistemas de ML en producción.
← IA Responsable y Gobernanza · Todos los dominios · Ingeniería de Datos para ML →
Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Aprueba tu examen →