Uma empresa coleta dados de várias fontes em um bucket S3, executa um trabalho ETL do AWS Glue para transformá-los e armazena a saída transformada em um data lake baseado em S3 consultado pelo Amazon Athena. A empresa precisa identificar registros correspondentes mesmo quando não há um identificador exclusivo compartilhado. Qual solução realizará isso?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Treinar e usar a transformação AWS Lake Formation FindMatches no trabalho ETL..
Por que esta é a resposta
A transformação AWS Lake Formation FindMatches é a solução correta porque foi projetada especificamente para identificar registros duplicados ou correspondentes em conjuntos de dados, mesmo na ausência de um identificador exclusivo compartilhado. Ela usa aprendizado de máquina para aprender a identificar registros que se referem à mesma entidade. As outras opções são incorretas: Usar a correspondência de padrões do Amazon Macie não é apropriado, pois o Macie foca na descoberta e proteção de dados sensíveis, não na correspondência de registros. Treinar e usar a classe AWS Glue PySpark Filter não é eficaz para este cenário, pois a filtragem geralmente requer critérios explícitos e não consegue identificar correspondências complexas sem um identificador. Particionar tabelas e usar o trabalho ETL para particionar os dados em um identificador exclusivo não resolve o problema de registros correspondentes sem um identificador existente; a partição organiza os dados, mas não os identifica.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão