Vous devez fusionner deux jeux de données (les commandes client et les descriptions de catalogue de produits) qui ont des structures et des formats différents, en faisant correspondre les enregistrements similaires et en supprimant les doublons. Quelle est la solution la plus appropriée pour faire correspondre et nettoyer ces données ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Exécuter des crawlers AWS Glue pour remplir le catalogue de données Glue et utiliser la transformation Glue FindMatches pour identifier les enregistrements similaires et dédupliquer les données..
Pourquoi c'est la réponse
La transformation Glue FindMatches est la solution la plus appropriée car elle est spécifiquement conçue pour identifier les enregistrements similaires dans des ensembles de données qui peuvent ne pas avoir de clés d'identification uniques ou des formats cohérents, ce qui est le cas ici avec des structures et des formats différents. Elle utilise l'apprentissage automatique pour faire correspondre des enregistrements même s'ils ne sont pas des correspondances exactes, puis déduplique les données. Les crawlers AWS Glue sont nécessaires pour cataloguer les données avant d'utiliser FindMatches. Écrire une fonction Lambda pour des comparaisons de chaînes de caractères serait inefficace et complexe pour des données hétérogènes et volumineuses. L'API Glue SearchTables est destinée à la recherche de métadonnées de tables, pas à la correspondance floue ou à la déduplication de données. Lake Formation est un service de sécurité et de gestion des données, pas un outil de transformation de données pour la correspondance floue.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise