Ein Unternehmen speichert semistrukturierte Transaktionsdaten in S3. Einige Dateien sind winzig, während andere mehrere zehn Terabyte groß sind. Die Quelle sendet einmal täglich einen vollständigen JSON-Snapshot und sendet auch geänderte Datensätze in den Data Lake. Ein Dateningenieur muss Change Data Capture (CDC) durchführen, um Änderungen am kostengünstigsten zu identifizieren. Welche Lösung ist die KOSTENGÜNSTIGSTE?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Verwenden Sie ein Open-Source-Data-Lake-Format, um die Datenquelle mit dem S3 Data Lake zusammenzuführen, um die neuen Daten einzufügen und die vorhandenen Daten zu aktualisieren..
Warum dies die Antwort ist
Die Verwendung eines Open-Source-Data-Lake-Formats wie Apache Hudi, Apache Iceberg oder Delta Lake ist die kostengünstigste Lösung. Diese Formate sind speziell für die Verwaltung von CDC in Data Lakes konzipiert. Sie ermöglichen effiziente Upserts (Einfügen neuer und Aktualisieren bestehender Datensätze) direkt in S3, ohne dass eine separate Datenbank oder ein komplexer Verarbeitungsdienst erforderlich ist. Dies reduziert die Betriebskosten erheblich, da keine zusätzlichen Datenbankinstanzen oder DMS-Aufgaben verwaltet werden müssen. Die Lambda-Funktion wäre bei großen Datenmengen ineffizient und teuer. Das Aufnehmen in RDS oder Aurora und die Verwendung von DMS sind teurer, da sie zusätzliche Datenbankressourcen und den DMS-Dienst erfordern, was die Kosten für Speicherung, Rechenleistung und Datenübertragung erhöht.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich