Amazon DEA-C01: Ingestión y recopilación de datos — Guía de estudio

Forma parte de la Amazon Data Engineer Associate DEA-C01 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Amazon, o realiza tests cronometrados en ExamRoll.io.

Este dominio cubre los patrones, los servicios de AWS y los detalles operativos utilizados para incorporar datos brutos a una plataforma de datos de manera fiable y a escala. Los ingenieros de datos deben elegir entre puntos de entrada por lotes (batch) y de transmisión (streaming), garantizar la catalogación y la capacidad de descubrimiento de los datos, y diseñar para el rendimiento (throughput), la capacidad de reproducción (replayability) y los modos de fallo. Los componentes clave de AWS son S3 y Glue para lotes, Kinesis y Firehose para transmisión, DMS para migración de bases de datos y CDC, y componentes controlados por API/eventos (API Gateway, Lambda, SNS, SQS, eventos de S3) para la ingesta ad-hoc y basada en eventos (push).

Ingesta por lotes con AWS Glue y S3

Glue es la principal solución gestionada de ETL y metadatos para la ingesta por lotes en S3 y su catálogo de datos. El patrón típico es: depositar los archivos brutos en S3 (con prefijos separados para zonas/brutos, raw/zone), ejecutar un crawler de Glue para inferir el esquema y poblar el Glue Data Catalog, y luego ejecutar trabajos ETL de Glue (Spark) para transformar, particionar, convertir a formatos columnares (Parquet/ORC) y escribir los datos optimizados de nuevo en S3. Configure los crawlers con los clasificadores apropiados (integrados para CSV/JSON/Parquet o personalizados con grok/regex) y asigne al crawler un rol de IAM que tenga permisos s3:GetObject/s3:ListBucket y glue:*catalog*; la falta de estos es un fallo operativo común.

Al configurar trabajos y crawlers de Glue, utilice estos patrones y opciones de la consola/CLI:

undefined

y iniciarlo con

undefined

.

undefined

; habilite los marcadores de trabajo (job bookmarks) para evitar el reprocesamiento. Criterios de decisión para Glue frente a alternativas:

Ingesta por transmisión con Kinesis Data Streams y Firehose

Kinesis Data Streams (KDS) es para la ingesta en tiempo real con capacidad de reproducción (replay), control del consumidor y escalado de grano fino. Un shard de Kinesis proporciona 1 MB/s o 1000 registros/s de capacidad de escritura y 2 MB/s de capacidad de lectura; use

undefined

e ingrese datos con

undefined

. Las claves de partición determinan la asignación de shards; una baja cardinalidad de la clave de partición causa shards sobrecargados (hot shards), evítelo aumentando la entropía de la clave o añadiendo un sufijo con un hash. Escale los shards usando

undefined

o habilite el modo On-Demand para el escalado automático.

Firehose es un servicio de flujo de entrega (delivery-stream) optimizado para la entrega casi en tiempo real (S3, Redshift, OpenSearch, Splunk) con búfer, compresión y transformación opcional con Lambda incorporados. Configure el almacenamiento en búfer con BufferingHints: buffer_size (MB) y buffer_interval (segundos) para ajustar la latencia de entrega frente al costo; habilite la compresión (GZIP, Snappy) y establezca una Lambda de procesamiento para transformaciones a nivel de registro. Diferencias clave:

Elija KDS cuando necesite reproducción, un control estricto del consumidor o múltiples consumidores posteriores; elija Firehose cuando necesite una entrega y transformación sencillas en S3/Redshift/OpenSearch con una sobrecarga operativa mínima.

Migración de bases de datos y CDC con DMS

AWS DMS se utiliza para migraciones homogéneas/heterogéneas y replicación continua (CDC). Despliegue una instancia de replicación (

undefined

) dimensionada para el rendimiento (throughput), cuyas decisiones de dimensionamiento se basan en la tasa de cambio, el volumen de la carga completa y el paralelismo de las tareas. Tipos de tareas de DMS:

Criterios de decisión entre full-load y CDC: use full-load+CDC cuando necesite una migración con un tiempo de inactividad mínimo; use solo CDC para la replicación continua después de que una carga inicial se haya completado por otro mecanismo. Valide siempre el mapeo de esquemas y ejecute migraciones de prueba con volúmenes de datos representativos.

Patrones de ingesta basados en API y orientados a eventos

Las API y los eventos se utilizan para la ingesta y orquestación basadas en push. Patrones comunes:

Consideraciones operativas y patrones de CLI:

Errores comunes y criterios de decisión

Problema práctico: escenario de caso de uso

RetailCo recopila clickstreams de móviles (alto volumen en tiempo real) y archivos nocturnos del catálogo de productos; necesitan paneles de control en tiempo real y un lago de datos (data lake) consolidado para análisis.

  1. Ingestar los clickstreams en Kinesis Data Streams con claves de partición derivadas de la sesión del usuario + un sufijo de shard con hash; crear consumidores usando Kinesis Data Analytics o Lambda/Kinesis Client Library para el procesamiento en tiempo real.
  2. Usar Kinesis Data Firehose con una función Lambda de transformación para persistir las salidas del streaming enriquecidas en S3 (Parquet), comprimir con Snappy y, opcionalmente, cargar en Redshift Spectrum para análisis.
  3. Colocar los archivos nocturnos del catálogo en S3 raw/ y ejecutar un crawler de Glue programado para actualizar el Glue Data Catalog, luego ejecutar trabajos ETL de Glue para convertirlos a Parquet particionado en la zona curada (curated zone).
  4. Usar notificaciones de eventos de S3 -> SNS -> Lambda para activar actualizaciones ligeras de metadatos o invalidar cachés; enrutar la entrega a SQS para un procesamiento posterior duradero.
  5. Monitorear las métricas de los shards de Kinesis (IncomingBytes, IncomingRecords, PutRecords.Success) y usar UpdateShardCount o flujos On-Demand para gestionar el crecimiento; habilitar alarmas de CloudWatch.

Justificación de las mejores prácticas de AWS: separar las rutas de tiempo real y de lote (batch), usar Kinesis Data Streams cuando se requiera reproducción (replay) y aislamiento de consumidores, usar Firehose para la entrega gestionada a S3/destinos, y mantener un Glue Data Catalog para el descubrimiento y la integración de consultas con Athena/Redshift.


Todos los dominios · Almacenamiento de datos y arquitectura de Data Lake

Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Aprueba tu examen →

Explorar Amazon →

Related guides

Acceso todo en uno

Una suscripción. Todos los exámenes.

Cada plan desbloquea la búsqueda ilimitada de respuestas, pruebas de práctica, explicaciones de AI y la biblioteca completa de recursos, en más de 20 idiomas.

Mensual
24.87
Just €0.83/day
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

Mejor valor
12 meses
179.87
Just €0.49/daySave 40%
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

✓ Plan gratuito incluido · ✓ Cancela en cualquier momento · ✓ Todos los planes desbloquean el producto completo