Ein Unternehmen verfügt über einen großen unstrukturierten Datensatz, der viele doppelte Datensätze über Schlüsselattribute hinweg enthält. Welche AWS-Lösung identifiziert Duplikate mit dem geringsten Aufwand an benutzerdefinierter Codierung?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Die AWS Glue FindMatches-Transformation verwenden, um doppelte Datensätze zu identifizieren..
Warum dies die Antwort ist
Die AWS Glue FindMatches-Transformation ist die effektivste Lösung, da sie speziell für die Identifizierung und Deduplizierung von Datensätzen entwickelt wurde, selbst wenn diese keine exakte Übereinstimmung aufweisen. Sie nutzt Machine Learning, um ähnliche Datensätze zu finden, ohne dass umfangreicher benutzerdefinierter Code erforderlich ist. Amazon Mechanical Turk wäre zu manuell und zeitaufwendig für einen großen Datensatz. Amazon QuickSight ML Insights ist für die Analyse von Daten und das Aufdecken von Mustern gedacht, nicht primär für die Deduplizierung von Rohdaten. Amazon SageMaker Data Wrangler ist ein hervorragendes Tool zur Datenvorverarbeitung, erfordert aber für die Deduplizierung in diesem Umfang mehr benutzerdefinierte Logik oder ML-Modelle als FindMatches.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich