Ein Unternehmen migriert eine ältere Anwendung zu einem S3-basierten Data Lake. Die Altdaten enthalten doppelte Datensätze. Der Dateningenieur muss Duplikate mit dem geringsten Betriebsaufwand identifizieren und entfernen. Welche Lösung sollte der Ingenieur wählen?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Schreiben Sie einen AWS Glue Extract-, Transform- und Load-Job (ETL). Verwenden Sie die FindMatches Machine Learning (ML)-Transformation, um die Daten zur Durchführung der Datendeduplizierung zu transformieren..
Warum dies die Antwort ist
Die AWS Glue FindMatches ML-Transformation ist die effizienteste Lösung, da sie speziell für die Identifizierung und Deduplizierung von Datensätzen entwickelt wurde, die nicht exakt übereinstimmen, aber logisch identisch sind (Fuzzy Matching). Dies ist typisch für Altdaten mit Inkonsistenzen. Sie erfordert den geringsten Betriebsaufwand, da sie ein verwalteter Service ist und Machine Learning nutzt, um Muster zu lernen und Duplikate zu finden, ohne dass komplexe benutzerdefinierte Logik geschrieben werden muss. Das Schreiben eines benutzerdefinierten Python-ETL mit DataFrame.dropduplicates() ist nur effektiv bei exakten Duplikaten und erfordert mehr Entwicklungs- und Wartungsaufwand. Die dedupe-Bibliothek ist zwar leistungsfähig für Fuzzy Matching, erfordert aber ebenfalls mehr benutzerdefinierte Implementierung und Verwaltung im Vergleich zur verwalteten Glue FindMatches-Transformation. Die Kombination von AWS Glue mit der dedupe-Bibliothek ist zwar technisch möglich, aber FindMatches bietet eine integrierte, optimierte und verwaltete Lösung für diesen Anwendungsfall.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich