Uma empresa está migrando um aplicativo legado para um data lake baseado em S3. Os dados legados contêm registros duplicados. O engenheiro de dados deve identificar e remover duplicatas com o MENOR overhead operacional. Qual solução o engenheiro deve escolher?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Escrever um job de extract, transform, and load (ETL) do AWS Glue. Usar a transformação de machine learning (ML) FindMatches para transformar os dados e realizar a deduplicação de dados..
Por que esta é a resposta
A transformação AWS Glue FindMatches é a melhor solução porque foi projetada especificamente para identificar e remover registros duplicados, mesmo quando não há uma correspondência exata, usando aprendizado de máquina. Isso minimiza o overhead operacional, pois o Glue gerencia a infraestrutura subjacente e o FindMatches é otimizado para essa tarefa. Escrever um job ETL customizado em Python com Pandas dropduplicates() é menos eficiente para grandes volumes de dados e só funciona para duplicatas exatas, não para registros semelhantes. Usar a biblioteca Python dedupe em um job customizado ou no AWS Glue exigiria mais configuração e gerenciamento manual do que a solução nativa FindMatches do Glue, aumentando o overhead operacional.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão