Une entreprise migre une application existante vers un lac de données basé sur S3. Les données existantes contiennent des enregistrements en double. L'ingénieur de données doit identifier et supprimer les doublons avec le MOINS de frais opérationnels. Quelle solution l'ingénieur doit-il choisir ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Écrire un job d'extraction, transformation et chargement (ETL) AWS Glue. Utiliser la transformation de machine learning (ML) FindMatches pour transformer les données afin d'effectuer la déduplication des données..
Pourquoi c'est la réponse
La solution optimale pour dédupliquer des données avec le moins de frais opérationnels est d'utiliser un job AWS Glue ETL avec la transformation ML FindMatches. AWS Glue est un service ETL sans serveur, ce qui minimise les frais opérationnels liés à la gestion de l'infrastructure. FindMatches est spécifiquement conçu pour identifier et dédupliquer des enregistrements même s'ils ne sont pas des doublons exacts, en utilisant des techniques de Machine Learning, ce qui est très efficace pour les données du monde réel. Les options impliquant des jobs ETL personnalisés en Python (avec Pandas ou la bibliothèque dedupe) nécessitent plus de développement, de maintenance et de gestion des ressources, augmentant ainsi les frais opérationnels. Bien que la bibliothèque dedupe puisse être utilisée dans un job AWS Glue, elle ne tire pas pleinement parti des capacités intégrées et optimisées de Glue pour la déduplication floue comme FindMatches, qui est plus adaptée pour des doublons non exacts et réduit la complexité du code.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise