Une entreprise dispose d'un grand ensemble de données non structurées contenant de nombreux enregistrements en double sur des attributs clés. Quelle solution AWS permettra d'identifier les doublons avec le moins de code personnalisé ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Utiliser la transformation AWS Glue FindMatches pour identifier les enregistrements en double..
Pourquoi c'est la réponse
AWS Glue FindMatches est une transformation d'apprentissage automatique qui identifie les enregistrements en double ou correspondants dans un ensemble de données sans nécessiter d'identifiants exacts. Elle est conçue spécifiquement pour ce cas d'utilisation et minimise le besoin de code personnalisé. Amazon Mechanical Turk est un service de crowdsourcing qui serait coûteux et lent pour un grand ensemble de données. Amazon QuickSight ML Insights est destiné à l'analyse et à la détection d'anomalies, pas à la déduplication de données brutes. Amazon SageMaker Data Wrangler est un outil de préparation de données qui peut aider au nettoyage, mais il n'inclut pas de fonctionnalité intégrée de déduplication basée sur le ML comme FindMatches, ce qui nécessiterait plus de code personnalisé.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise