Une société d'investissement ingère un volume croissant de données semi-structurées et doit dédupliquer les enregistrements, en supprimant les doublons et les fautes d'orthographe courantes. Quelle option offre cette capacité avec le moins de frais opérationnels ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Utiliser la fonctionnalité FindMatches d'AWS Glue pour supprimer les enregistrements en double..
Pourquoi c'est la réponse
La fonctionnalité FindMatches d'AWS Glue est conçue spécifiquement pour identifier et dédupliquer des enregistrements dans des ensembles de données, même lorsque les doublons ne sont pas des correspondances exactes (par exemple, fautes d'orthographe ou variations). Elle utilise le machine learning pour grouper des enregistrements similaires, ce qui réduit considérablement les frais opérationnels par rapport à des approches de codage manuel. Les fonctions non-Windows dans Amazon Athena sont des fonctions SQL qui peuvent aider à l'identification de doublons exacts, mais elles ne gèrent pas les fautes d'orthographe ou les correspondances floues sans un développement complexe. Amazon Neptune ML est un service de graphes et de machine learning pour des cas d'utilisation de graphes, pas pour la déduplication de données semi-structurées. Les tables globales d'Amazon DynamoDB sont utilisées pour la réplication de données entre régions et ne fournissent pas de mécanisme de déduplication intelligent pour des données semi-structurées avec des variations.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise