Amazon DEA-C01: Qualidade, Validação e Observabilidade de Dados — Guia de estudos

Faz parte do Amazon Data Engineer Associate DEA-C01 — Guia de estudos. Pratique com respostas verificadas no centro de exames da Amazon, ou faça testes cronometrados no ExamRoll.io.

Este domínio abrange as práticas de ponta a ponta e os serviços da AWS usados para garantir a correção dos dados, detectar anomalias e manter a confiabilidade dos pipelines. Validação e observabilidade robustas reduzem defeitos em etapas posteriores, atendendo aos SLAs e permitindo o reprocessamento seguro. Engenheiros de dados devem combinar o Glue Data Quality, frameworks de validação, detecção de anomalias do CloudWatch, DLQs e design idempotente para construir pipelines robustos.

Regras e avaliação do AWS Glue Data Quality

O Glue Data Quality usa conjuntos de regras da Data Quality Definition Language (DQDL) para definir asserções sobre conjuntos de dados (contagens de linhas, limiares de nulos, unicidade, verificações SQL personalizadas). Crie conjuntos de regras no console ou com a CLI (padrão de exemplo:

undefined

). Os conjuntos de regras podem ser anexados a jobs de ETL do Glue ou executados de forma independente por meio das APIs

undefined

/

undefined

para avaliar conjuntos de dados armazenados no S3, tabelas do catálogo ou Glue DynamicFrames.

Principais detalhes de configuração e critérios de decisão:

undefined

,

undefined

(DQDL ou SQL),

undefined

e

undefined

. Defina explicitamente a ação em caso de falha como

undefined

para o job quando verificações críticas falharem; caso contrário, o Glue pode registrar os resultados sem falhar a execução.

Quando usar o Glue Data Quality vs. frameworks externos:

Padrões de validação de dados em pipelines

A validação deve ocorrer em múltiplos pontos de contato: entrada (ingress), transformação e destino (sink). Padrões comuns:

undefined

ou inclua parâmetros de job para acionar as execuções de avaliação.

undefined

) e carregue o DataContext no job:

undefined

após sincronizar as expectativas do S3 com o ambiente do job.

Comparação das opções de validação:

Para streaming, valide os registros em trânsito e, em caso de falha, envie para uma DLQ do SQS (configure a

undefined

com

undefined

via AWS CLI ou console) em vez de descartá-los. Para batch, gere um artefato de relatório de validação e falhe ou coloque as saídas em quarentena com base na política.

Detecção de anomalias e monitoramento de desvio de dados (data drift)

Use a detecção de anomalias do CloudWatch para métricas operacionais (registros processados, taxa de erro, duração do job). Crie um detector com a CLI:

undefined

e, em seguida, crie alarmes do CloudWatch que referenciem a banda de detecção de anomalias. Para desvio no nível dos dados (mudanças de distribuição, alterações na taxa de nulos), agende jobs de perfil do Glue DataBrew (

undefined

) para calcular estatísticas, histogramas e quantis; armazene os perfis no S3 como linhas de base (baselines).

Critérios de decisão para alarmes de anomalia vs. de limiar:

Para detecção automatizada de desvio (drift):

Gerenciamento de SLA e confiabilidade do pipeline

O gerenciamento de SLA conecta a observabilidade à remediação e à engenharia de confiabilidade. Instrumente cada pipeline com estas métricas de base: vazão (registros/seg), latência (ingestão→sink), taxa de erro, tempo de execução do job e contagens downstream. Use o CloudWatch Metrics para jobs do Glue (métricas de execução de job), lag de consumidor do Kinesis/Kafka e métricas de aplicação personalizadas via PutMetricData.

Padrões de confiabilidade e detalhes de configuração:

Critérios de decisão para retry vs. fail-fast:

Armadilhas Comuns e Critérios de Decisão

Problema Prático: Cenário de Caso de Uso

A Streamline Retail enfrenta erros frequentes nos relatórios downstream após o ETL noturno: alterações inesperadas ocasionais no schema, violações silenciosas de regras e pedidos duplicados ao reprocessar execuções com falha.

  1. Implemente regras do Glue Data Quality (DQDL) para schema, limites de nulos e unicidade em order_id; defina a ação em caso de falha para FAIL no job e publique os artefatos de avaliação no S3.
  2. Adicione o Great Expectations em um passo de Glue Python Shell para verificações de negócio complexas (consistência de pedidos entre tabelas); armazene as expectativas (expectations) no S3 e execute checkpoints no pipeline.
  3. Agende jobs de perfil do DataBrew para capturar baselines diários (cardinalidade, taxa de nulos, percentis) e use comparações automatizadas para detectar desvios (drift).
  4. Para eventos de pedidos em streaming, configure uma DLQ do SQS com uma RedrivePolicy apropriada e crie um job de replay para processar mensagens da DLQ de forma idempotente (usando order_id como a chave de deduplicação).
  5. Instrumente detectores de anomalias do CloudWatch para o tempo de execução do job e a contagem de erros; anexe alarmes baseados em anomalias ao SNS para escalonamento da equipe de plantão (on-call).

Justificativa da best-practice da AWS: combine os controles de qualidade nativos do Glue para uma integração rápida, o Great Expectations para expressividade, o DataBrew para estatísticas de linha de base e os detectores de anomalias do CloudWatch para monitoramento adaptativo. DLQs e sinks idempotentes fecham o ciclo para novas tentativas (retries) e reprocessamento seguros, enquanto preservam os SLAs.


Otimização de Custos para Cargas de Trabalho de Dados · Todos os domínios

Pratique estas questões → · Prática cronometrada no ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Passe no seu exame →

Navegar Amazon →

Related guides

Acesso completo

Uma assinatura. Todos os exames.

Todo plano desbloqueia pesquisa ilimitada de respostas, testes práticos, explicações de AI e a biblioteca completa de recursos — em mais de 20 idiomas.

Mensal
24.87
Just €0.83/day
Tudo incluído:
  • Pesquisa ilimitada de respostas
  • Testes práticos ilimitados
  • Explicações com AI
  • Biblioteca completa de recursos
  • Mais de 20 idiomas
  • Atualizações semanais de conteúdo
  • Recompensas e indicações
  • Suporte prioritário
Iniciar teste grátis

*Não é necessário cartão de crédito

Melhor custo-benefício
12 meses
179.87
Just €0.49/daySave 40%
Tudo incluído:
  • Pesquisa ilimitada de respostas
  • Testes práticos ilimitados
  • Explicações com AI
  • Biblioteca completa de recursos
  • Mais de 20 idiomas
  • Atualizações semanais de conteúdo
  • Recompensas e indicações
  • Suporte prioritário
Iniciar teste grátis

*Não é necessário cartão de crédito

✓ Plano gratuito incluído · ✓ Cancele a qualquer momento · ✓ Todos os planos desbloqueiam o produto completo