Amazon DEA-C01: Otimização de Custos para Cargas de Trabalho de Dados — Guia de estudos
Faz parte do Amazon Data Engineer Associate DEA-C01 — Guia de estudos. Pratique com respostas verificadas no centro de exames da Amazon, ou faça testes cronometrados no ExamRoll.io.
Capacidade reservada e Savings Plans para serviços de dados
A capacidade reservada e os Savings Plans se aplicam de forma diferente entre os serviços de dados. Para serviços baseados em EC2 (EMR, HBase autogerenciado, Hadoop customizado), use EC2 Savings Plans ou Reserved Instances para cobrir os gastos de computação; selecione opções regionais ou zonais com base nas necessidades de mobilidade. O Redshift suporta a compra de nós reservados para clusters provisionados para reduzir os custos por hora de workloads de data warehouse previsíveis. Serviços serverless (Glue, Athena) não possuem reservas de recursos; em vez disso, otimize por meio do agendamento de workloads e de alterações no formato dos dados.
Orientações práticas de compra:
- Compre Redshift Reserved Nodes para workloads de data warehouse de estado estável com utilização conhecida (avalie os prazos de 1 ou 3 anos e as opções de pagamento total/parcial/sem adiantamento).
- Use EC2 Savings Plans para cobrir gastos previsíveis de EMR/EC2 entre famílias de instâncias; os Savings Plans oferecem flexibilidade caso a família de instâncias ou a região mude.
- Não compre reservas para serviços serverless; em vez disso, otimize os padrões de uso, o agendamento e o layout dos dados.
Armadilhas Comuns e Critérios de Decisão
- O Athena escaneia a tabela inteira sem particionamento — sempre particione tabelas grandes de séries temporais por data ou outras colunas de alta cardinalidade e filtradas com frequência, e converta para Parquet/ORC para minimizar os bytes escaneados.
- O auto-scaling de DPUs do Glue pode superprovisionar — defina um limite máximo de DPUs na configuração do job (no console ou via
aws glue update-job) e escolha os tipos de worker apropriados para manter os custos previsíveis. - Taxas de recuperação do S3 Glacier — evite a recuperação Expedited, a menos que seja crítica para o negócio; planeje a recuperação Standard ou Bulk e defina transições de ciclo de vida com SLAs realistas.
- Os nós master e core do EMR não devem usar Spot — configure os nós master/core como On-Demand e atribua Spot apenas aos nós de tarefa (task nodes), evitando ou replicando o estado do HDFS.
- Muitos objetos pequenos no S3 inflam os custos de requisição e retardam as análises — compacte arquivos pequenos em arquivos colunares maiores durante a ingestão.
- A dependência excessiva do concurrency scaling ou do auto-scaling não gerenciado pode aumentar os custos por hora — monitore as métricas de escalonamento, defina limites e use capacidade reservada quando as workloads forem previsíveis.
Problema Prático: Redução de custos do ETL noturno da Acme Analytics
A Acme Analytics executa ETLs noturnos e análises ad-hoc diárias; os gastos mensais com a nuvem dispararam devido ao aumento do armazenamento de dados brutos no S3 e das horas on-demand do Redshift. A empresa precisa de uma redução de 35% sem impactar os SLAs noturnos.
- Execute a S3 Storage Class Analysis e crie regras de ciclo de vida para mover arquivos brutos frios com mais de 90 dias para o Glacier Flexible Retrieval (planeje recuperações Bulk/Standard).
- Converta os CSVs brutos para o formato Parquet particionado e comprimido, e compacte os arquivos pequenos; armazene os conjuntos de dados otimizados sob prefixos separados para o Athena/Redshift Spectrum.
- Crie workgroups no Athena com limites de dados escaneados por consulta e imponha as configurações do workgroup; habilite o reuso de resultados de consulta e defina um orçamento mensal por workgroup.
- Migre o ETL em lote para jobs do tipo Glue Flex para transformações não urgentes, defina limites máximos de DPU e agende-os para horários de menor pico; mantenha uma frota menor de Glue padrão para jobs urgentes.
- Redimensione (right-size) o Redshift: compre Reserved Nodes de 1 ano para a computação de base estável, mova dados históricos para o S3 e use o Spectrum para consultas infrequentes, e habilite o concurrency scaling apenas com monitoramento.
Justificativa: A estratégia combina a otimização do formato de dados e do ciclo de vida (reduzindo custos de armazenamento e de escaneamento), a execução serverless de menor custo para jobs flexíveis (Glue Flex), a governança de consultas (workgroups do Athena) e a capacidade reservada para computação sustentada para maximizar os descontos, preservando a disponibilidade e o desempenho.
← Monitoramento e Solução de Problemas de Pipeline de Dados · Todos os domínios · Qualidade →
Pratique estas questões → · Prática cronometrada no ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Passe no seu exame →