Une entreprise lit des données provenant de plusieurs bases de données client Amazon RDS où les noms et les formats des champs sont incohérents (par exemple, place_id dans une base de données et location_id dans une autre). L'entreprise doit lier les enregistrements client entre les bases de données même lorsque les noms de champs diffèrent. Quelle solution offre cette capacité avec le MOINS de frais opérationnels ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Créer un crawler AWS Glue pour explorer les bases de données. Utiliser la transformation FindMatches pour trouver les enregistrements en double dans les données. Évaluer et ajuster la transformation en examinant les performances et les résultats..
Pourquoi c'est la réponse
La solution correcte est d'utiliser un crawler AWS Glue et la transformation FindMatches. AWS Glue est un service ETL sans serveur qui découvre automatiquement les schémas de données (même incohérents) via ses crawlers, réduisant ainsi les frais opérationnels par rapport à la gestion d'un cluster EMR. La transformation FindMatches de Glue est spécifiquement conçue pour l'appariement d'enregistrements et la déduplication, même lorsque les champs sont nommés différemment, sans nécessiter de codage ML complexe. Les options impliquant Amazon EMR nécessitent la gestion de serveurs et de clusters, ce qui augmente les frais opérationnels. Bien qu'Apache Spark ML ou SageMaker puissent être utilisés pour l'appariement d'enregistrements, ils demandent plus d'efforts de développement et de maintenance que la transformation FindMatches pré-construite de Glue, qui est optimisée pour ce cas d'utilisation.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise