Amazon DEA-C01: Almacenamiento de datos y arquitectura de Data Lake — Guía de estudio

Forma parte de la Amazon Data Engineer Associate DEA-C01 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Amazon, o realiza tests cronometrados en ExamRoll.io.

Este dominio cubre cómo los servicios de almacenamiento y los motores de bases de datos de AWS soportan la ingesta de datos a gran escala, el archivado duradero, el rendimiento de las consultas y la gobernanza segura en las plataformas de datos modernas. Los ingenieros de datos deben equilibrar el costo, la latencia de acceso, la durabilidad y el control de acceso detallado al integrar servicios como S3, Lake Formation, Redshift y DynamoDB en las canalizaciones. Comprender los compromisos de las clases de almacenamiento, la automatización del ciclo de vida, el almacenamiento gestionado frente al local y los patrones de particionamiento previene sorpresas de rendimiento y costo en producción.

Clases de almacenamiento y políticas de ciclo de vida de Amazon S3

S3 ofrece múltiples clases de almacenamiento y controles de ciclo de vida para optimizar el costo y los patrones de acceso. Configure la clase de almacenamiento al momento de la carga (consola o CLI:

undefined

) o use reglas de ciclo de vida del bucket (aws s3api put-bucket-lifecycle-configuration –bucket my-bucket –lifecycle-configuration file://lifecycle.json). Intelligent-Tiering mueve automáticamente los objetos entre niveles de acceso frecuente e infrecuente y tiene una pequeña tarifa de monitoreo; actívelo para patrones de acceso desconocidos o cambiantes. Use reglas de ciclo de vida para transferir objetos a GLACIER o DEEP_ARCHIVE para retención a largo plazo y para expirar/eliminar versiones antiguas.

Criterios de decisión y compromisos:

Notas operativas:

Diseño de data lake con S3 y Lake Formation

Diseñe un data lake con S3 como el almacén de objetos central y Lake Formation para el control de acceso y la catalogación centralizados. Registre las ubicaciones de S3 como recursos de Lake Formation, configure un AWS Glue Data Catalog y use concesiones de Lake Formation para bases de datos/tablas (aws lakeformation grant-permissions –principal arn:aws:iam::123456789012:user/analyst –permissions SELECT –resource ‘{…}’). Lake Formation puede aplicar controles detallados: a nivel de columna, a nivel de fila (expresiones de filtro) y enmascaramiento a nivel de celda usando LF-tags y filtros de datos aplicados a las consultas de Glue/Athena.

Patrones clave de configuración y gobernanza:

Puntos de decisión:

Arquitectura y almacenamiento de Amazon Redshift

Redshift separa el cómputo y el almacenamiento gestionado en los nodos RA3 frente a los nodos DS2 respaldados por SSD locales. Los nodos RA3 utilizan Redshift Managed Storage (RMS), donde los datos residen en Amazon S3 gestionado por el clúster; elija RA3 para un almacenamiento escalable con un rendimiento de consulta consistente y la capacidad de pagar por el cómputo por separado. Los nodos DS2 almacenan datos en discos locales de la instancia, lo que requiere un dimensionamiento y redimensionamiento cuidadosos cuando los datos crecen.

Detalles de configuración y operativos:

Comparación (RA3 vs DS2):

DynamoDB y selección de bases de datos específicas

Elija DynamoDB para cargas de trabajo de clave-valor y de documentos a gran escala que requieran una latencia de milisegundos de un solo dígito. El diseño de la tabla depende de la selección de la clave de partición (y la clave de ordenación opcional): utilice claves de alta cardinalidad y bien distribuidas para evitar particiones calientes. Para claves secuenciales o basadas en marcas de tiempo, implemente prefijos aleatorios (sharding) o use UUIDs para distribuir las escrituras. Use la capacidad bajo demanda para evitar el aprovisionamiento, pero considere la capacidad aprovisionada con autoescalado para cargas de trabajo predecibles y para aprovechar la capacidad adaptativa en particiones calientes.

Notas prácticas de configuración:

undefined

.

Criterios de decisión para la selección del motor:

Errores comunes y criterios de decisión

Problema práctico: Escenario de caso de uso

Acme Media debe almacenar 50 TB de ingesta de video sin procesar, proporcionar a los analistas acceso de consulta a los metadatos transformados y aplicar acceso a nivel de fila y columna para diferentes unidades de negocio, minimizando al mismo tiempo el costo de almacenamiento.

  1. Ingestar el video sin procesar en S3 usando carga multiparte, etiquetar los objetos por fecha de ingesta y conjunto de datos, y usar Intelligent-Tiering para los patrones de acceso iniciales desconocidos.
  2. Configurar reglas de ciclo de vida para transferir los medios a GLACIER o DEEP_ARCHIVE después de un período de retención configurable (asegurar la alineación con los más de 30 días si se considera Standard-IA).
  3. Registrar las ubicaciones de S3 en Lake Formation, crear crawlers de Glue para poblar el Catálogo de Datos y otorgar permisos a nivel de fila y columna basados en etiquetas de LF a las unidades de negocio.
  4. Almacenar metadatos curados en Redshift RA3 para análisis; adjuntar un rol de IAM al clúster para COPY desde S3 y usar operaciones VACUUM/ANALYZE en ventanas de mantenimiento.
  5. Usar DynamoDB con claves UUID con hash para una tabla de consulta de alto rendimiento para manifiestos de video y habilitar la capacidad bajo demanda para absorber picos de tráfico.

Justificación: Este enfoque aísla el costo del almacenamiento en frío con las clases de Glacier, usa Intelligent-Tiering para patrones desconocidos, aplica Lake Formation para un control de acceso seguro y detallado en todos los motores de análisis, y selecciona RA3 para un almacenamiento de análisis escalable, mientras que DynamoDB maneja las búsquedas operativas de baja latencia.


Ingestión y recopilación de datos · Todos los dominios · Catalogación de datos y gestión de metadatos

Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Aprueba tu examen →

Explorar Amazon →

Related guides

Acceso todo en uno

Una suscripción. Todos los exámenes.

Cada plan desbloquea la búsqueda ilimitada de respuestas, pruebas de práctica, explicaciones de AI y la biblioteca completa de recursos, en más de 20 idiomas.

Mensual
24.87
Just €0.83/day
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

Mejor valor
12 meses
179.87
Just €0.49/daySave 40%
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

✓ Plan gratuito incluido · ✓ Cancela en cualquier momento · ✓ Todos los planes desbloquean el producto completo