Uma empresa de investimentos ingere um volume crescente de dados semiestruturados e precisa deduplicar registros, removendo duplicatas e erros de digitação comuns. Qual opção oferece essa capacidade com o menor overhead operacional?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Usar o recurso FindMatches do AWS Glue para remover registros duplicados..
Por que esta é a resposta
O AWS Glue FindMatches é um recurso de machine learning que identifica e deduplica registros, mesmo que não haja um identificador comum ou correspondência exata, o que é ideal para dados semiestruturados com erros de digitação. Ele minimiza o overhead operacional, pois o Glue gerencia a infraestrutura. Funções não-Windows no Amazon Athena podem remover duplicatas exatas, mas não lidam com erros de digitação ou correspondências aproximadas. O Amazon Neptune ML e Apache Gremlin são para grafos e não são a ferramenta principal para deduplicação de dados semiestruturados. As tabelas globais do Amazon DynamoDB são para replicação de dados e não para deduplicação inteligente.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão