Amazon DEA-C01: Consulta e Análise de Dados — Guia de estudos

Faz parte do Amazon Data Engineer Associate DEA-C01 — Guia de estudos. Pratique com respostas verificadas no centro de exames da Amazon, ou faça testes cronometrados no ExamRoll.io.

Este domínio abrange o projeto, o ajuste e a operação de serviços da AWS que suportam consultas analíticas e BI em grandes conjuntos de dados. Ele se concentra em padrões de consulta econômicos e de alto desempenho no Athena, Redshift, OpenSearch e QuickSight, e como eles interoperam com o S3, Glue e armazenamentos transacionais. O domínio exige equilibrar o formato de armazenamento, o particionamento, o tipo de computação e o posicionamento dos dados para minimizar os bytes escaneados e o desvio de rede (network skew), ao mesmo tempo em que entrega insights de baixa latência.

Otimização de consultas no Amazon Athena

A precificação do Athena é baseada em bytes escaneados, então o layout físico dos dados e os metadados são as principais alavancas de otimização. Use formatos colunares (Parquet ou ORC) com compressão (Snappy para Parquet, opções Zlib/ORC) para reduzir o tamanho e o uso de CPU. Particione os dados por colunas de alta cardinalidade e filtradas em consultas (data, região) e registre as partições no Glue Data Catalog. Padrões típicos:

undefined

e use crawlers do Glue ou o comando

undefined

para popular as partições.

undefined

para impor a compressão colunar.

Quando as consultas exigem joins com armazenamentos transacionais, use o Athena Federated Query (conectores Lambda) para realizar joins entre diferentes fontes de dados com RDS, DynamoDB ou Redshift. Os conectores são implantados como funções Lambda e registrados como fontes de dados no Athena; fluxo de exemplo no console: Athena > Data sources > Connectors > New. Critérios de decisão:

Ajuste de consultas e distribuição no Amazon Redshift

O desempenho do Redshift depende do estilo de distribuição (distribution style) e das chaves de ordenação (sort keys) para minimizar a movimentação de dados e habilitar o mapeamento de zona (zone mapping). Escolha os estilos de DIST usando estes pontos de decisão:

Defina SORTKEYs em colunas usadas em filtros de intervalo ou em cláusulas ORDER BY para habilitar os zone maps e reduzir as leituras de disco. Comandos operacionais comuns:

undefined

undefined

; monitore

undefined

e

undefined

para métricas de distorção (skew) e distribuição. O Redshift Spectrum permite que você consulte tabelas externas do S3 por meio do Glue Data Catalog. Crie o esquema externo com:

undefined

Critérios de decisão para Spectrum vs. Redshift nativo:

Amazon OpenSearch Service para análise de logs

O OpenSearch é otimizado para ingestão e análise rápida e ad-hoc de logs; a configuração de seus índices e do cluster determina o throughput e o custo. Design e ciclo de vida do índice:

undefined

e um template de índice para definir

undefined

(índices pequenos: 1 shard; grandes: múltiplos shards com tamanho entre ~10–50 GB) e

undefined

para disponibilidade.

QuickSight para BI e visualização

O QuickSight oferece dashboards rápidos com dois modos principais de ingestão: SPICE (em memória) e consulta direta (direct query). O SPICE oferece desempenho abaixo de um segundo para dashboards e é adequado para leituras repetidas; consultas SQL diretas (para Athena, Redshift, RDS) são preferíveis para conjuntos de dados muito grandes ou dados que mudam com frequência. Configurações chave e melhores práticas:

Armadilhas Comuns e Critérios de Decisão

Problema Prático: Cenário de Caso de Uso

A Acme Retail precisa de relatórios de BI diários combinando pedidos transacionais no Amazon RDS, eventos de clickstream no S3 e perfis de usuário do DynamoDB, com limites de custo e atualizações de dashboard abaixo de um minuto para dados recentes.

  1. Converter os dados de clickstream do S3 para o formato Parquet particionado (baseado em data), comprimir com Snappy e registrar os metadados no AWS Glue por meio de um crawler.
  2. Usar o Athena para consultas ad-hoc no S3 e implantar conectores de Federated Query para o RDS e o DynamoDB para realizar joins com dimensões pequenas; materializar os resultados de joins frequentes como Parquet se as consultas forem repetidas.
  3. Provisionar o Redshift para joins analíticos pesados: carregar snapshots agregados no Redshift, definir a DISTKEY em um customer_id de alta cardinalidade e definir a SORTKEY em order_date; usar o Spectrum para dados históricos frios (cold data) no S3.
  4. Ingerir logs de aplicação no OpenSearch com padrões de índice diários; aplicar ILM para manter os índices recentes em nós quentes (hot nodes) e mover os índices mais antigos para o UltraWarm para economizar custos.
  5. Construir dashboards no QuickSight: importar agregados recentes para o SPICE com atualizações incrementais agendadas para uma responsividade percebida abaixo de um minuto, e usar consultas diretas (direct queries) para métricas sempre atualizadas.

Justificativa: Essa abordagem minimiza os custos de escaneamento do Athena por meio de particionamento e formatos colunares, reduz o network shuffle do Redshift com chaves de distribuição e de ordenação (sort keys) adequadas, usa o Spectrum para evitar o armazenamento de dados frios (cold data) no Redshift, aplica o ILM do OpenSearch para otimizar o custo de armazenamento e aproveita o SPICE para dashboards responsivos, enquanto mantém a atualização crítica por meio de consultas diretas (direct queries).


Orquestração de Dados e Gerenciamento de Fluxo de Trabalho · Todos os domínios · Segurança

Pratique estas questões → · Prática cronometrada no ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Passe no seu exame →

Navegar Amazon →

Related guides

Acesso completo

Uma assinatura. Todos os exames.

Todo plano desbloqueia pesquisa ilimitada de respostas, testes práticos, explicações de AI e a biblioteca completa de recursos — em mais de 20 idiomas.

Mensal
24.87
Just €0.83/day
Tudo incluído:
  • Pesquisa ilimitada de respostas
  • Testes práticos ilimitados
  • Explicações com AI
  • Biblioteca completa de recursos
  • Mais de 20 idiomas
  • Atualizações semanais de conteúdo
  • Recompensas e indicações
  • Suporte prioritário
Iniciar teste grátis

*Não é necessário cartão de crédito

Melhor custo-benefício
12 meses
179.87
Just €0.49/daySave 40%
Tudo incluído:
  • Pesquisa ilimitada de respostas
  • Testes práticos ilimitados
  • Explicações com AI
  • Biblioteca completa de recursos
  • Mais de 20 idiomas
  • Atualizações semanais de conteúdo
  • Recompensas e indicações
  • Suporte prioritário
Iniciar teste grátis

*Não é necessário cartão de crédito

✓ Plano gratuito incluído · ✓ Cancele a qualquer momento · ✓ Todos os planos desbloqueiam o produto completo