Amazon DEA-C01: Seguridad, gobernanza y cumplimiento de datos — Guía de estudio
Forma parte de la Amazon Data Engineer Associate DEA-C01 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Amazon, o realiza tests cronometrados en ExamRoll.io.
Este dominio abarca los controles, servicios y patrones operativos que mantienen los datos protegidos, auditables y en conformidad, a la vez que permiten su análisis. Los ingenieros de datos deben diseñar el cifrado, el control de acceso, el descubrimiento y el enmascaramiento de datos para que los flujos de trabajo de análisis se ejecuten sin exponer PII o interrumpir las integraciones de servicios. La siguiente sección se centra en servicios y configuraciones concretas de AWS —cifrado en S3/Redshift, KMS, políticas de IAM y de recursos, acceso detallado con Lake Formation, descubrimiento con Macie y controles de red como los VPC endpoints— además de los criterios de decisión que utilizará al diseñar pipelines.
Cifrado en reposo y en tránsito para los servicios de datos
Cifre los datos en tránsito utilizando TLS para todos los endpoints de servicios de AWS y los SDK de cliente; imponga esta medida con endpoints de servicio, ALBs, API Gateway y exigiendo HTTPS en las políticas de bucket de S3. Para el cifrado en reposo en S3, elija entre SSE-S3, SSE-KMS, SSE-C o el cifrado del lado del cliente con las siguientes ventajas y desventajas y patrones de CLI/consola:
- SSE-S3 (AES-256 gestionado por AWS): el más simple; habilite el cifrado por defecto en un bucket con aws s3api put-bucket-encryption –bucket my-bucket –server-side-encryption-configuration ‘{“Rules”:[{“ApplyServerSideEncryptionByDefault”:{“SSEAlgorithm”:“AES256”}}]}’.
- SSE-KMS (claves de AWS KMS): admite la rotación de claves, políticas de IAM y de clave de KMS, y auditoría a través de CloudTrail; establezca el cifrado por defecto del bucket con SSE-KMS y especifique –sse-kms-key-id. Requiere conceder a los servicios y principales tanto permisos de IAM como acceso mediante la política de clave de KMS (consulte la nota sobre la política de clave de KMS a continuación).
- SSE-C (claves proporcionadas por el cliente): el cliente suministra la clave en cada solicitud; no se utiliza KMS; complejidad operativa para la transferencia de claves y el manejo de la exposición de claves.
- Cifrado del lado del cliente: cifre antes de la subida utilizando el AWS Encryption SDK o bibliotecas de cliente para el cifrado de sobre; las claves son gestionadas por el cliente o mediante un uso personalizado de KMS. Utilícelo cuando deba mantener el control total del material de la clave en texto plano.
Criterios de decisión:
- Utilice SSE-S3 para una baja sobrecarga operativa y cuando no se gestionen claves por parte del cliente.
- Utilice SSE-KMS para la auditabilidad, la rotación de claves y al compartir instantáneas cifradas entre cuentas o servicios.
- Utilice SSE-C o el cifrado del lado del cliente cuando deba asegurarse de que AWS nunca tenga acceso al texto plano o al material de la clave.
Cifrado en Redshift: habilite el cifrado en la creación del clúster especificando –encrypted y –kms-key-id o a través de la consola. El cifrado no se puede habilitar directamente en un clúster no cifrado; para cifrar una instantánea de un clúster existente y restaurarla en un clúster cifrado, utilice aws redshift create-cluster o el flujo de trabajo RestoreFromClusterSnapshot con –kms-key-id. La política de clave de KMS debe permitir explícitamente a Redshift usar la clave (kms:Encrypt, kms:Decrypt, kms:GenerateDataKey).
Para todos los servicios que utilizan KMS, asegure el uso de TLS en tránsito y limite la exposición de texto plano en los registros e instantáneas.
Políticas de IAM y políticas basadas en recursos para el acceso a datos
Las políticas de identidad de IAM y las políticas basadas en recursos (políticas de bucket de S3, políticas de clave de KMS, políticas de VPC endpoint) determinan conjuntamente el acceso. Un enfoque específico:
- Utilice roles de IAM para los principales de cómputo/servicio (EMR, Glue, Redshift, Lambda) y adjunte políticas de privilegio mínimo que permitan las acciones necesarias en S3, Glue, Redshift y KMS.
- Utilice políticas basadas en recursos para restringir qué principales o VPC endpoints pueden acceder a los buckets de S3 o a las APIs; aplique declaraciones Deny explícitas con cuidado, ya que un Deny anula un Allow.
- Para el acceso restringido a una VPC, cree un VPC endpoint de tipo gateway para S3 y endpoints de tipo interfaz para Glue, KMS, Secrets Manager, y controle el acceso con políticas de endpoint.
Patrones de CLI/consola:
- Crear un endpoint de tipo gateway: aws ec2 create-vpc-endpoint –vpc-id vpc-123 –service-name com.amazonaws.us-east-1.s3 –route-table-ids rtb-123
- Crear un endpoint de tipo interfaz para Glue: aws ec2 create-vpc-endpoint –vpc-id vpc-123 –service-name com.amazonaws.us-east-1.glue –subnet-ids subnet-1 subnet-2 –security-group-ids sg-1
Criterios de decisión:
- Utilice políticas de recursos para aplicar restricciones entre cuentas o para requerir que el tráfico se origine desde VPC endpoints específicos.
- Utilice IAM para permisos centrados en la identidad y políticas de clave de KMS para autorizar a los servicios a usar las claves — IAM por sí solo es insuficiente para permitir el uso de KMS.
Permisos detallados de Lake Formation
Lake Formation centraliza el control de acceso al data lake sobre el Glue Data Catalog y proporciona seguridad a nivel de columna y de fila para Athena y los trabajos de Glue. Patrones clave:
- Registre las ubicaciones de S3 como ubicaciones del data lake en Lake Formation y conceda DATA_LOCATION_ACCESS al rol que lee/escribe en esas ubicaciones.
- Conceda permisos a nivel de tabla y de columna a través de la consola de Lake Formation o con aws lakeformation grant-permissions; los permisos a nivel de columna utilizan un parámetro de lista de columnas y afectan a las consultas de Athena y Glue que usan el Data Catalog.
- Para la seguridad a nivel de fila, defina LF-tags o filtros de fila en las tablas y adjunte políticas que apliquen predicados a los datos devueltos por Athena. Los filtros a nivel de fila son evaluados por el servicio de Lake Formation durante la planificación de la consulta.
Detalles operativos:
- Se evalúan tanto los permisos de Lake Formation como los de IAM; se aplica el resultado más restrictivo. Asegúrese de que los trabajos tengan tanto acceso a S3 mediante el rol de IAM como los permisos concedidos en Lake Formation.
- Al usar Athena, configure el grupo de trabajo para que utilice el Glue Data Catalog y configure la ubicación de los resultados de la consulta en S3 con el acceso adecuado de LF.
Criterios de decisión:
- Utilice los controles a nivel de columna de Lake Formation cuando necesite ocultar columnas sensibles a los analistas posteriores.
- Utilice políticas a nivel de fila para conjuntos de datos multi-tenant donde los predicados de fila deben restringir la visibilidad por principal.
- Continúe usando políticas de IAM y de bucket de S3 para una aplicación de políticas de grano grueso (a nivel de bucket/objeto) y Lake Formation para una aplicación de grano fino impulsada por el catálogo.
Enmascaramiento de datos, tokenización y manejo de PII
Detecte PII (Información de Identificación Personal) usando Amazon Macie para escanear buckets de S3 y ejecutar trabajos de clasificación con identificadores de datos gestionados. Macie proporciona descubrimiento automatizado y alertas para PII, y los hallazgos pueden ser dirigidos a Security Hub o CloudWatch Events para flujos de trabajo posteriores. Configure los trabajos de Macie a través de la consola o con
undefined
, seleccione el alcance del bucket de S3 y elija los identificadores gestionados.
Para enmascaramiento y tokenización:
- Use transformaciones de AWS Glue (ETL de Glue con PySpark) o AWS Lambda para aplicar enmascaramiento/tokenización determinista o que preserve el formato durante la ingesta. Considere los marcadores de trabajo (job bookmarks) y los parámetros de trabajo de AWS Glue Studio para un procesamiento consistente.
- Para la tokenización donde los tokens deben ser reversibles, use un HSM respaldado por KMS o un servicio de tokenización de terceros; almacene los mapas de tokens en una tabla de DynamoDB protegida, cifrada con KMS, y restrinja el acceso a los servicios autorizados.
- Para el enmascaramiento irreversible, aplique un hashing unidireccional (con sal) utilizando sales seguras de Secrets Manager y rote las sales cuidadosamente para evitar romper las uniones (joins).
Redes y tráfico privado:
- Use endpoints de puerta de enlace (gateway) de S3 y endpoints de interfaz para Glue y Secrets Manager para mantener el tráfico de datos dentro de la red de AWS y evitar la exposición a la internet pública. Combine las políticas de endpoint de VPC con las políticas de bucket de S3 para restringir el acceso al tráfico proveniente de las entidades principales del endpoint.
Errores Comunes y Criterios de Decisión
- El cifrado de Redshift no se puede habilitar en un clúster existente no cifrado; restaure desde una instantánea (snapshot) a un nuevo clúster con
undefined
para crear un clúster cifrado.
- Las políticas de clave de KMS deben otorgar explícitamente a la entidad principal del servicio de datos de AWS (p. ej.,
undefined
,
undefined
) permiso para
undefined
/
undefined
; los permisos del rol de IAM por sí solos son insuficientes.
- Se evalúan tanto los permisos de Lake Formation como los de IAM; si cualquiera de los dos deniega el acceso o carece de los permisos necesarios, el acceso será bloqueado. Otorgue tanto el acceso a S3 al rol de IAM como los derechos sobre tablas/columnas en Lake Formation.
- Las políticas de bucket de S3 con una denegación explícita (Deny) anularán los permisos de concesión (Allow) de IAM; audite las políticas de bucket en busca de declaraciones Deny que bloqueen involuntariamente los roles de servicio o el acceso entre cuentas.
- Las políticas de endpoint de VPC o una configuración incorrecta del endpoint pueden bloquear silenciosamente el tráfico del servicio; valide la entidad principal del endpoint y las asociaciones de la tabla de rutas para los endpoints de puerta de enlace, y los grupos de seguridad para los endpoints de interfaz.
- Macie requiere acceso de lectura a S3 y políticas de bucket adecuadas; asegúrese de que la entidad principal del servicio de Macie esté permitida o ejecute los escaneos desde un rol con los permisos necesarios.
Problema Práctico: Escenario de Caso de Uso
Acme Health Analytics almacena archivos CSV de pacientes en un data lake de S3 y debe proporcionar a los analistas acceso a campos desidentificados, conservando al mismo tiempo la capacidad de ejecutar consultas agregadas; el tráfico nunca debe atravesar la internet pública.
- Registre las ubicaciones del data lake de S3 en Lake Formation y cree un rol de administrador del data lake dedicado.
- Configure el cifrado por defecto del bucket con SSE-KMS y cree una clave KMS cuya política de clave otorgue explícitamente acceso a las entidades principales de los servicios Glue, Athena y Redshift, y a los roles de IAM de los analistas.
- Use Lake Formation para otorgar SELECT a nivel de tabla a los analistas, pero aplique denegaciones a nivel de columna para las columnas con PII y cree filtros a nivel de fila si se requiere segmentación multi-tenant.
- Ejecute trabajos de clasificación de Macie para descubrir cualquier PII restante en los buckets y remediarlo mediante enmascaramiento/tokenización en trabajos ETL de Glue; use patrones de tokenización o del lado del cliente para tokens reversibles y hash para enmascaramiento irreversible.
- Cree un endpoint de VPC de puerta de enlace (gateway) para S3 y endpoints de interfaz para Glue y Secrets Manager; aplique políticas de endpoint para restringir el acceso al tráfico de la VPC y ajuste las políticas de bucket de S3 para permitir únicamente a la entidad principal del endpoint.
Justificación de la mejor práctica de AWS: combine el cifrado respaldado por KMS, los controles de catálogo de grano fino de Lake Formation y los endpoints de VPC privados para aplicar una defensa en profundidad. El cifrado protege los datos en reposo, Lake Formation controla qué columnas/filas son visibles, y los endpoints de VPC evitan la exposición a la red pública, mientras que las políticas de KMS aseguran que los servicios puedan realmente descifrar los datos.
← Consulta y análisis de datos · Todos los dominios · Monitoreo y resolución de problemas de pipelines de datos →
Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Aprueba tu examen →