Amazon DEA-C01: Monitoreo y resolución de problemas de pipelines de datos — Guía de estudio

Forma parte de la Amazon Data Engineer Associate DEA-C01 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Amazon, o realiza tests cronometrados en ExamRoll.io.

La monitorización y resolución de problemas de las canalizaciones de datos es fundamental para garantizar la entrega puntual y precisa de datos de streaming y por lotes en AWS. Este dominio abarca la telemetría, las alertas y las técnicas de diagnóstico para servicios como Kinesis, Firehose, Glue, DMS, Lambda y los registros de auditoría de AWS que respaldan la investigación de incidentes. Una monitorización eficaz reduce el Tiempo Medio de Detección/Recuperación (Mean Time To Detect/Recover) al exponer el retraso del consumidor (consumer lag), la presión sobre los recursos de los trabajos, la latencia de entrega y el acceso no autorizado. Las siguientes secciones ofrecen señales concretas, patrones de CLI/consola y criterios de decisión para operar y remediar los flujos de datos de producción.

Métricas y alarmas de CloudWatch para servicios de datos

CloudWatch es el plano de telemetría principal: cree filtros de métricas, paneles (dashboards) y alarmas para las métricas clave de los servicios e integre las alarmas con SNS, EventBridge o Systems Manager para una remediación automatizada. Use

undefined

para crear alarmas programáticamente; los indicadores (flags) típicos incluyen –metric-name, –namespace, –statistic (o –extended-stat), –threshold, –evaluation-periods y –comparison-operator. Para los paneles, envíe métricas personalizadas (p. ej., desde los metadatos de un trabajo de Glue) usando

undefined

con un namespace como “MyCompany/DataPipeline”.

Céntrese en estas métricas y patrones procesables:

Criterios de decisión para las alertas:

Monitorización y manejo de errores en trabajos de Glue

Glue emite métricas a CloudWatch y escribe logs en /aws-glue/jobs/output (logs de ejecución del trabajo) y /aws-glue/jobs/error (errores). Use CloudWatch Logs Insights para consultar las ejecuciones de los trabajos: ejecute consultas a través de la consola o con

undefined

con una cadena de consulta como

undefined

. Rastree BytesRead, BytesWritten, RecordsProcessed y DPUHrs desde las métricas de ejecución del trabajo de Glue—DPUHrs se correlaciona directamente con el coste y el paralelismo del trabajo.

Modos de fallo comunes en Glue y su remediación:

Compromisos en la toma de decisiones:

Monitorización de Kinesis y Firehose

Retraso del consumidor de Kinesis (Consumer Lag): confíe en GetRecords.IteratorAgeMilliseconds para detectar cuán atrasados están los consumidores. Si GetRecords.IteratorAgeMilliseconds es consistentemente alto:

Use

undefined

para inspeccionar el número de shards y

undefined

para IteratorAgeMilliseconds. Al comparar las opciones de remediación, considere:

Métricas de entrega de Firehose: DeliveryToS3.DataFreshness cuantifica la latencia de entrega; los ajustes típicos de buffering_delay son de 60 a 900 segundos y retendrán los registros hasta que se alcance bufferSize o bufferInterval. Si DeliveryToS3.DataFreshness es alto:

undefined

.

Recuerde la semántica de almacenamiento en búfer (buffering) de Firehose: el servicio retrasa intencionadamente la entrega hasta el intervalo del búfer; reduzca el intervalo del búfer para disminuir la latencia a costa de escrituras más frecuentes en S3.

CloudTrail y auditoría de acceso a datos

CloudTrail proporciona actividad de API y, opcionalmente, eventos de datos para S3 y Lambda, los cuales no están habilitados por defecto. Para capturar eventos de S3 a nivel de objeto, habilite explícitamente los eventos de datos en CloudTrail a través de la consola o con aws cloudtrail create-trail --include-global-service-events y añada los recursos de datos de S3. Sin habilitar los eventos de datos de S3, no verá los eventos GetObject/PutObject en CloudTrail, lo que es una omisión común durante las investigaciones.

Use los registros de CloudTrail en combinación con CloudWatch Logs Insights para correlacionar métricas operativas (p. ej., registros de trabajos de Glue) con eventos de acceso. Patrones de consulta:

Las tareas de replicación de DMS también publican métricas en CloudWatch: monitoree FullLoadRows para la completitud de la copia inicial, CDCLatencyMilliseconds para detectar la latencia de replicación, y AppliedChanges para asegurar que las transacciones se están aplicando en el destino. Cree alarmas para CDCLatencyMilliseconds cuando exceda los SLAs de negocio y para un valor bajo de AppliedChanges después de un aumento en las filas de carga completa (full load rows).

Errores Comunes y Criterios de Decisión

Problema Práctico: Escenario de Caso de Uso

Acme Analytics realiza una ingesta de clickstream en tiempo real a través de Kinesis, enriquece eventos usando trabajos ETL de Glue, persiste lotes antiguos a través de Firehose en S3 y replica bases de datos heredadas con DMS. Observan retrasos de extremo a extremo: latencia del consumidor en Kinesis, errores OOM en trabajos de Glue y Firehose mostrando un valor alto en DeliveryToS3.DataFreshness.

  1. Analizar los consumidores de Kinesis: obtener la métrica GetRecords.IteratorAgeMilliseconds, inspeccionar los registros del consumidor y realizar un análisis de costos entre Kinesis enhanced fan-out y el escalado por shards.
  2. Examinar las métricas de CloudWatch del trabajo de Glue y Logs Insights en busca de stack traces de OOM; probar el reparticionamiento + predicado de pushdown localmente o en un trabajo más pequeño; solo entonces aumentar el DPU/tipo de worker si es necesario.
  3. Inspeccionar la configuración del búfer de Firehose (BufferIntervalInSeconds) y DeliveryToS3.DataFreshness; reducir el intervalo del búfer para SLOs críticos y validar los permisos de escritura en S3/KMS.
  4. Configurar alarmas compuestas de CloudWatch que combinen IteratorAgeMilliseconds, la tasa de error del trabajo de Glue y Firehose DataFreshness; entregar alertas a un tema de SNS para el personal de guardia y activar un runbook a través de EventBridge.
  5. Habilitar los eventos de datos de S3 en CloudTrail y correlacionar los eventos GetObject/PutObject con los tiempos de inicio de los trabajos de Glue y los cambios aplicados de DMS para detectar accesos no autorizados o retrasados.

Este enfoque sigue las mejores prácticas de AWS: monitorear las métricas de servicio correctas con la granularidad adecuada, preferir correcciones de código y configuración específicas antes de escalar recursos, y asegurar que el registro a nivel de auditoría esté habilitado explícitamente para permitir un análisis rápido de la causa raíz y una remediación automatizada.


Seguridad · Todos los dominios · Optimización de costos para cargas de trabajo de datos

Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Aprueba tu examen →

Explorar Amazon →

Related guides

Acceso todo en uno

Una suscripción. Todos los exámenes.

Cada plan desbloquea la búsqueda ilimitada de respuestas, pruebas de práctica, explicaciones de AI y la biblioteca completa de recursos, en más de 20 idiomas.

Mensual
24.87
Just €0.83/day
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

Mejor valor
12 meses
179.87
Just €0.49/daySave 40%
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

✓ Plan gratuito incluido · ✓ Cancela en cualquier momento · ✓ Todos los planes desbloquean el producto completo