Sie müssen zwei Datensätze – Kundenbestellungen und Produktkatalogbeschreibungen – zusammenführen, die unterschiedliche Strukturen und Formate aufweisen, ähnliche Datensätze abgleichen und Duplikate entfernen. Welche Lösung ist am besten geeignet, um diese Daten abzugleichen und zu bereinigen?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: AWS Glue Crawler ausführen, um den Glue Data Catalog zu füllen, und die Glue FindMatches-Transformation verwenden, um ähnliche Datensätze zu identifizieren und die Daten zu deduplizieren..
Warum dies die Antwort ist
Die korrekte Antwort ist die Verwendung von AWS Glue Crawler und der Glue FindMatches-Transformation. AWS Glue Crawler scannt die Datenquellen und füllt den Glue Data Catalog mit Metadaten, was für die weitere Verarbeitung unerlässlich ist. Die Glue FindMatches-Transformation ist speziell für das Fuzzy-Matching und die Deduplizierung von Datensätzen konzipiert, selbst wenn diese keine exakten Übereinstimmungen aufweisen, was ideal für die Zusammenführung von Datensätzen mit unterschiedlichen Strukturen und Formaten ist. Das Schreiben einer AWS Lambda-Funktion wäre zu aufwendig und weniger effizient für komplexe Fuzzy-Matching-Szenarien. Die Glue SearchTables API ist für die Suche im Data Catalog gedacht, nicht für das Fuzzy-Matching und die Deduplizierung von Dateninhalten. Lake Formation Custom Transformations sind zwar leistungsstark, aber FindMatches in Glue ist die spezifischere und optimierte Lösung für dieses Problem.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich