Ein Investmentunternehmen nimmt ein ständig wachsendes Volumen an semistrukturierten Daten auf und muss Datensätze deduplizieren, indem es Duplikate und häufige Rechtschreibfehler entfernt. Welche Option bietet diese Funktion mit dem geringsten Betriebsaufwand?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Verwenden Sie die FindMatches-Funktion von AWS Glue, um doppelte Datensätze zu entfernen..
Warum dies die Antwort ist
Die FindMatches-Funktion von AWS Glue ist speziell für die Identifizierung und Deduplizierung von Datensätzen konzipiert, die keine exakten Übereinstimmungen sind, aber ähnliche Informationen enthalten – ideal für semistrukturierte Daten mit Rechtschreibfehlern. Dies minimiert den Betriebsaufwand, da AWS Glue ein vollständig verwalteter Dienst ist und die ML-Modelle für die Fuzzy-Matching-Logik trainiert werden können. Nicht-Window-Funktionen in Amazon Athena können zwar exakte Duplikate entfernen, sind aber nicht effektiv bei der Erkennung von Rechtschreibfehlern oder ähnlichen, aber nicht identischen Datensätzen. Amazon Neptune ML und Apache Gremlin sind für Graphdatenbanken und maschinelles Lernen auf Graphen optimiert, nicht primär für die Deduplizierung semistrukturierter Daten. Amazon DynamoDB Global Tables dienen der Replikation von Daten über Regionen hinweg und verhindern keine Duplikate innerhalb der Daten selbst.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich