Amazon DEA-C01: Monitoramento e Solução de Problemas de Pipeline de Dados — Guia de estudos

Faz parte do Amazon Data Engineer Associate DEA-C01 — Guia de estudos. Pratique com respostas verificadas no centro de exames da Amazon, ou faça testes cronometrados no ExamRoll.io.

O monitoramento e a solução de problemas de pipelines de dados são essenciais para garantir a entrega pontual e precisa de dados de streaming e em lote na AWS. Este domínio abrange as técnicas de telemetria, alertas e diagnóstico para serviços como Kinesis, Firehose, Glue, DMS, Lambda e as trilhas de auditoria da AWS que auxiliam na investigação de incidentes. Um monitoramento eficaz reduz o Tempo Médio para Detectar/Recuperar (Mean Time To Detect/Recover) ao expor o lag do consumidor, a pressão de recursos do job, a latência de entrega e o acesso não autorizado. As seções a seguir fornecem sinais concretos, padrões de CLI/console e critérios de decisão para operar e remediar fluxos de dados de produção.

Métricas e alarmes do CloudWatch para serviços de dados

O CloudWatch é o plano de telemetria principal: crie filtros de métricas, dashboards e alarmes para as principais métricas de serviço e integre os alarmes com o SNS, EventBridge ou Systems Manager para remediação automatizada. Use aws cloudwatch put-metric-alarm para criar alarmes programaticamente; as flags típicas incluem --metric-name, --namespace, --statistic (ou --extended-stat), --threshold, --evaluation-periods e --comparison-operator. Para dashboards, envie métricas personalizadas (por exemplo, de metadados de jobs do Glue) usando aws cloudwatch put-metric-data com um namespace como “MyCompany/DataPipeline”.

Concentre-se nestas métricas e padrões acionáveis:

Critérios de decisão para alertas:

Monitoramento e tratamento de erros em jobs do Glue

O Glue emite métricas para o CloudWatch e grava logs em /aws-glue/jobs/output (logs de execução do job) e /aws-glue/jobs/error (erros). Use o CloudWatch Logs Insights para consultar as execuções dos jobs: execute consultas pelo console ou com aws logs start-query com uma string de consulta como fields @timestamp, @message | filter @message like /ERROR/ | sort @timestamp desc | limit 20. Acompanhe BytesRead, BytesWritten, RecordsProcessed e DPUHrs a partir das métricas de execução do job do Glue — DPUHrs se correlaciona diretamente com o custo e o paralelismo do job.

Modos de falha comuns do Glue e remediação:

Trade-offs de decisão:

Monitoramento do Kinesis e do Firehose

Lag do Consumidor do Kinesis: confie em GetRecords.IteratorAgeMilliseconds para detectar o quão atrasados os consumidores estão. Se GetRecords.IteratorAgeMilliseconds estiver consistentemente alto:

Use aws kinesis describe-stream para inspecionar a contagem de shards e aws cloudwatch get-metric-statistics para GetRecords.IteratorAgeMilliseconds. Ao comparar as opções de remediação, considere:

Métricas de entrega do Firehose: DeliveryToS3.DataFreshness quantifica a latência de entrega; configurações típicas de buffering_delay são de 60 a 900 segundos e manterão os registros até que o bufferSize ou o bufferInterval seja atingido. Se DeliveryToS3.DataFreshness estiver alto:

Lembre-se da semântica de buffering do Firehose: o serviço atrasa intencionalmente até o intervalo de buffer; reduza o intervalo de buffer para diminuir a latência, ao custo de escritas mais frequentes no S3.

CloudTrail e auditoria de acesso a dados

O CloudTrail fornece atividade de API e, opcionalmente, eventos de dados para o S3 e Lambda, que não são habilitados por padrão. Para capturar eventos de S3 no nível do objeto, habilite explicitamente os eventos de dados no CloudTrail através do console ou com aws cloudtrail create-trail --include-global-service-events e adicione os recursos de dados do S3. Sem habilitar os eventos de dados do S3, você não verá GetObject/PutObject no CloudTrail, o que é uma lacuna comum durante as investigações.

Use os logs do CloudTrail combinados com o CloudWatch Logs Insights para correlacionar métricas operacionais (ex: logs de jobs do Glue) com eventos de acesso. Padrões de consulta:

As tarefas de replicação do DMS também publicam métricas no CloudWatch: monitore FullLoadRows para verificar a conclusão da cópia inicial, CDCLatencyMilliseconds para detectar latência na replicação (lag) e AppliedChanges para garantir que as transações estão sendo aplicadas no destino. Crie alarmes para CDCLatencyMilliseconds que excedam os SLAs de negócio e para um baixo valor de AppliedChanges após um aumento nas linhas de carga total (full load rows).

Armadilhas Comuns e Critérios de Decisão

Problema Prático: Cenário de Caso de Uso

A Acme Analytics executa a ingestão de clickstream em tempo real via Kinesis, enriquece eventos usando jobs de ETL do Glue, persiste lotes antigos (stale batches) via Firehose no S3 e replica bancos de dados legados com o DMS. Eles observam atrasos de ponta a ponta: lag do consumidor no Kinesis, OOMs em jobs do Glue e o Firehose mostrando um alto valor para DeliveryToS3.DataFreshness.

  1. Analise o perfil dos consumidores do Kinesis: colete a métrica GetRecords.IteratorAgeMilliseconds, inspecione os logs do consumidor e execute uma análise de custo comparando o enhanced fan-out do Kinesis com o escalonamento de shards.
  2. Examine as métricas do CloudWatch e os Logs Insights do job do Glue em busca de stack traces de OOM; teste o reparticionamento + predicado de pushdown localmente ou em um job menor; somente então aumente o DPU/tipo de worker, se necessário.
  3. Inspecione as configurações de buffer do Firehose (BufferIntervalInSeconds) e a métrica DeliveryToS3.DataFreshness; reduza o intervalo de buffer para SLOs críticos e valide as permissões de escrita no S3/KMS.
  4. Configure alarmes compostos no CloudWatch combinando IteratorAgeMilliseconds, a taxa de erro do job do Glue e a métrica DataFreshness do Firehose; entregue os alertas para um tópico SNS de plantão (on-call) e acione um runbook via EventBridge.
  5. Habilite os eventos de dados do S3 no CloudTrail e correlacione os eventos GetObject/PutObject com os horários de início dos jobs do Glue e as alterações aplicadas pelo DMS (AppliedChanges) para detectar acessos não autorizados ou atrasados.

Esta abordagem segue as melhores práticas da AWS: monitorar as métricas de serviço corretas na granularidade adequada, preferir correções direcionadas de código e configuração antes de escalar recursos, e garantir que o registro em nível de auditoria esteja explicitamente habilitado para permitir uma análise rápida da causa raiz e remediação automatizada.


Segurança · Todos os domínios · Otimização de Custos para Cargas de Trabalho de Dados

Pratique estas questões → · Prática cronometrada no ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Passe no seu exame →

Navegar Amazon →

Related guides

Acesso completo

Uma assinatura. Todos os exames.

Todo plano desbloqueia pesquisa ilimitada de respostas, testes práticos, explicações de AI e a biblioteca completa de recursos — em mais de 20 idiomas.

Mensal
24.87
Just €0.83/day
Tudo incluído:
  • Pesquisa ilimitada de respostas
  • Testes práticos ilimitados
  • Explicações com AI
  • Biblioteca completa de recursos
  • Mais de 20 idiomas
  • Atualizações semanais de conteúdo
  • Recompensas e indicações
  • Suporte prioritário
Iniciar teste grátis

*Não é necessário cartão de crédito

Melhor custo-benefício
12 meses
179.87
Just €0.49/daySave 40%
Tudo incluído:
  • Pesquisa ilimitada de respostas
  • Testes práticos ilimitados
  • Explicações com AI
  • Biblioteca completa de recursos
  • Mais de 20 idiomas
  • Atualizações semanais de conteúdo
  • Recompensas e indicações
  • Suporte prioritário
Iniciar teste grátis

*Não é necessário cartão de crédito

✓ Plano gratuito incluído · ✓ Cancele a qualquer momento · ✓ Todos os planos desbloqueiam o produto completo