Amazon DEA-C01: Ingestão e Coleta de Dados — Guia de estudos

Faz parte do Amazon Data Engineer Associate DEA-C01 — Guia de estudos. Pratique com respostas verificadas no centro de exames da Amazon, ou faça testes cronometrados no ExamRoll.io.

Este domínio abrange os padrões, serviços da AWS e detalhes operacionais usados para trazer dados brutos para uma plataforma de dados de forma confiável e em escala. Engenheiros de dados devem escolher entre pontos de entrada em lote (batch) e em tempo real (streaming), garantir a catalogação e a descoberta de dados, e projetar para throughput (vazão), capacidade de reprocessamento (replayability) e modos de falha. Os principais componentes da AWS são o S3 e o Glue para batch, Kinesis e Firehose para streaming, DMS para migração de banco de dados e CDC, e componentes orientados a API/eventos (API Gateway, Lambda, SNS, SQS, eventos do S3) para ingestão ad-hoc e baseada em push.

Ingestão em lote (batch) com AWS Glue e S3

O Glue é a principal solução gerenciada de ETL e metadados para ingestão em lote no S3 e no seu catálogo de dados. O padrão típico é: depositar arquivos brutos no S3 (usando prefixos separados para zonas raw/bruta), executar um crawler do Glue para inferir o esquema e popular o Glue Data Catalog, e então executar jobs de ETL do Glue (Spark) para transformar, particionar, converter para formatos colunares (Parquet/ORC) e gravar os dados otimizados de volta no S3. Configure os crawlers com os classificadores apropriados (integrados para CSV/JSON/Parquet ou customizados com grok/regex) e conceda ao crawler uma IAM role com permissões s3:GetObject/s3:ListBucket e glue:catalog — a falta dessas permissões é uma falha operacional comum.

Ao configurar jobs e crawlers do Glue, use estes padrões e opções no console/CLI:

undefined

e inicie com

undefined

.

undefined

; habilite os job bookmarks para evitar o reprocessamento. Critérios de decisão para o Glue vs. alternativas:

Ingestão em tempo real (streaming) com Kinesis Data Streams e Firehose

O Kinesis Data Streams (KDS) é para ingestão em tempo real com capacidade de reprocessamento (replay), controle de consumidores e escalabilidade granular. Um shard do Kinesis fornece 1 MB/s ou 1.000 registros/s de capacidade de escrita e 2 MB/s de capacidade de leitura; use

undefined

e insira dados com

undefined

. As chaves de partição determinam para qual shard os dados são enviados; uma baixa cardinalidade da chave de partição causa “hot shards” (shards sobrecarregados) — evite isso aumentando a entropia da chave ou adicionando um sufixo com um hash. Escale os shards usando

undefined

ou habilite o modo On-Demand para escalabilidade automática.

O Firehose é um serviço de stream de entrega otimizado para entrega em tempo quase real (near-real-time) para destinos como S3, Redshift, OpenSearch e Splunk, com buffering, compressão e transformação opcional com Lambda integrados. Configure o buffering com BufferingHints: buffer_size (MB) e buffer_interval (segundos) para ajustar a latência de entrega versus o custo; habilite a compressão (GZIP, Snappy) e defina uma função Lambda de processamento para transformações no nível do registro. Principais diferenças:

Escolha o KDS quando precisar de reprocessamento (replay), forte controle sobre os consumidores ou múltiplos consumidores downstream; escolha o Firehose quando precisar de entrega e transformação simples para S3/Redshift/OpenSearch com o mínimo de sobrecarga operacional.

Migração de banco de dados e CDC com DMS

O AWS DMS é usado para migrações homogêneas/heterogêneas e replicação contínua (CDC). Implante uma instância de replicação (

undefined

) dimensionada para o throughput necessário, com decisões de dimensionamento baseadas na taxa de alteração, volume da carga completa e paralelismo das tarefas. Tipos de tarefa do DMS:

Critérios de decisão entre full-load e CDC: use full-load+CDC quando precisar de uma migração com tempo de inatividade (downtime) mínimo; use apenas CDC para replicação contínua após uma carga inicial ter sido concluída por outro mecanismo. Sempre valide o mapeamento de esquema e execute migrações de teste com volumes de dados representativos.

Padrões de ingestão baseados em API e orientados a eventos

APIs e eventos são para ingestão e orquestração baseadas em push. Padrões comuns:

undefined

; use filtros de prefixo/sufixo para limitar os gatilhos. Para fan-out, roteie S3 -> tópico SNS -> múltiplas filas SQS/assinantes Lambda para entregar o mesmo evento a múltiplos consumidores sem acoplamento.

Questões operacionais e padrões de CLI:

Armadilhas Comuns e Critérios de Decisão

undefined

e

undefined

para que os crawlers possam popular o Data Catalog.

undefined

e

undefined

com base na latência aceitável e no volume de requisições.

Problema Prático: Cenário de Caso de Uso

A RetailCo coleta clickstreams de dispositivos móveis (alto volume em tempo real) e arquivos noturnos de catálogo de produtos; eles precisam de dashboards em tempo real e um lago de analytics consolidado.

  1. Ingerir clickstreams no Kinesis Data Streams com chaves de partição derivadas da sessão do usuário + um sufixo de shard com hash; criar consumidores usando Kinesis Data Analytics ou Lambda/Kinesis Client Library para processamento em tempo real.
  2. Usar o Kinesis Data Firehose com uma função Lambda de transformação para persistir as saídas de streaming enriquecidas no S3 (Parquet), comprimir com Snappy e, opcionalmente, carregar no Redshift Spectrum para analytics.
  3. Colocar os arquivos de catálogo noturnos em

undefined

e executar um crawler agendado do Glue para atualizar o Glue Data Catalog, depois executar jobs de ETL do Glue para converter para Parquet particionado na zona curada (curated zone). 4. Usar notificações de eventos do S3 -> SNS -> Lambda para disparar atualizações leves de metadados ou invalidar caches; rotear a entrega para o SQS para processamento downstream durável. 5. Monitorar as métricas de shard do Kinesis (IncomingBytes, IncomingRecords, PutRecords.Success) e usar

undefined

ou streams On-Demand para lidar com o crescimento; habilitar alarmes do CloudWatch.

Justificativa da boa prática da AWS: separar os caminhos de tempo real e de lote (batch), usar o Kinesis Data Streams quando replay e isolamento de consumidores são necessários, usar o Firehose para entrega gerenciada para o S3/destinos e manter um Glue Data Catalog para descoberta e integração de consultas com o Athena/Redshift.


Todos os domínios · Armazenamento de Dados e Arquitetura de Lake

Pratique estas questões → · Prática cronometrada no ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Passe no seu exame →

Navegar Amazon →

Related guides

Acesso completo

Uma assinatura. Todos os exames.

Todo plano desbloqueia pesquisa ilimitada de respostas, testes práticos, explicações de AI e a biblioteca completa de recursos — em mais de 20 idiomas.

Mensal
24.87
Just €0.83/day
Tudo incluído:
  • Pesquisa ilimitada de respostas
  • Testes práticos ilimitados
  • Explicações com AI
  • Biblioteca completa de recursos
  • Mais de 20 idiomas
  • Atualizações semanais de conteúdo
  • Recompensas e indicações
  • Suporte prioritário
Iniciar teste grátis

*Não é necessário cartão de crédito

Melhor custo-benefício
12 meses
179.87
Just €0.49/daySave 40%
Tudo incluído:
  • Pesquisa ilimitada de respostas
  • Testes práticos ilimitados
  • Explicações com AI
  • Biblioteca completa de recursos
  • Mais de 20 idiomas
  • Atualizações semanais de conteúdo
  • Recompensas e indicações
  • Suporte prioritário
Iniciar teste grátis

*Não é necessário cartão de crédito

✓ Plano gratuito incluído · ✓ Cancele a qualquer momento · ✓ Todos os planos desbloqueiam o produto completo