Ein Unternehmen sammelt Daten aus vielen Quellen in einem S3-Bucket, führt einen AWS Glue ETL-Job aus, um sie zu transformieren, und speichert die transformierten Ausgaben in einem S3-basierten Data Lake, der von Amazon Athena abgefragt wird. Das Unternehmen muss übereinstimmende Datensätze identifizieren, auch wenn es keinen gemeinsamen eindeutigen Bezeichner gibt. Welche Lösung wird dies erreichen?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Trainieren und verwenden Sie die AWS Lake Formation FindMatches-Transformation im ETL-Job..
Warum dies die Antwort ist
Die AWS Lake Formation FindMatches-Transformation ist die korrekte Lösung, da sie speziell dafür entwickelt wurde, übereinstimmende Datensätze in einem Datensatz zu identifizieren, auch wenn es keinen gemeinsamen eindeutigen Bezeichner gibt. Sie verwendet Machine Learning, um Datensätze abzugleichen, die sich auf dieselbe reale Entität beziehen. Amazon Macie ist für die Erkennung sensibler Daten und nicht für das Abgleichen von Datensätzen konzipiert. Die AWS Glue PySpark Filter-Klasse kann Daten filtern, aber nicht Datensätze ohne eindeutige Bezeichner abgleichen. Das Partitionieren von Tabellen ist eine Optimierungstechnik für Abfragen und erfordert bereits einen eindeutigen Bezeichner oder eine definierte Partitionierungsstrategie, um effektiv zu sein.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich