Uma empresa armazena dados transacionais semiestruturados no S3. Alguns arquivos são minúsculos, enquanto outros têm dezenas de terabytes. A origem envia um snapshot JSON completo uma vez por dia e também envia registros alterados para o data lake. Um engenheiro de dados deve realizar a captura de dados alterados (CDC) para identificar as alterações da forma mais econômica. Qual solução é a MAIS econômica?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Use um formato de data lake de código aberto para mesclar a fonte de dados com o data lake do S3 para inserir os novos dados e atualizar os dados existentes..
Por que esta é a resposta
A solução mais econômica é usar um formato de data lake de código aberto (como Apache Hudi, Apache Iceberg ou Delta Lake). Esses formatos permitem operações de mesclagem (merge), inserção (upsert) e exclusão (delete) diretamente no S3, o que é essencial para CDC. Eles otimizam o armazenamento e a consulta de dados alterados, evitando a reescrita completa de arquivos e o processamento de snapshots inteiros. As outras opções são menos eficientes ou mais caras: A função Lambda exigiria lógica complexa para comparar grandes volumes de dados e seria ineficiente para arquivos de dezenas de terabytes. Ingerir dados no Amazon RDS ou Aurora MySQL e usar o AWS DMS adiciona a complexidade e o custo de um banco de dados relacional para um caso de uso que pode ser resolvido diretamente no data lake. Além disso, o DMS é mais adequado para migração de bancos de dados inteiros ou replicação contínua de logs de transação, não para CDC de arquivos semiestruturados no S3.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão