Ein Unternehmen extrahiert täglich etwa 1 TB Daten aus Quellen wie SAP HANA, SQL Server, MongoDB, Kafka und DynamoDB. Einige Quellen haben undefinierte oder sich entwickelnde Schemata. Die Lösung muss Schemata erkennen, ETL durchführen und die Daten innerhalb von 15 Minuten nach der Datenerstellung in S3 laden. Welcher Ansatz bietet die erforderliche Funktionalität mit dem geringsten Betriebsaufwand?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Verwenden Sie AWS Glue, um das Schema zu erkennen und die Daten zu extrahieren, zu transformieren und in den S3-Bucket zu laden. Erstellen Sie eine Pipeline in Apache Spark..
Warum dies die Antwort ist
AWS Glue ist ein vollständig verwalteter ETL-Dienst, der Schemaerkennung (mit dem Glue Crawler), Datenextraktion, -transformation und -laden (mit Glue Jobs, die Apache Spark verwenden) bietet. Dies erfüllt die Anforderungen an die Schemaerkennung und die Verarbeitung großer Datenmengen (1 TB täglich) innerhalb des Zeitfensters von 15 Minuten mit geringem Betriebsaufwand, da Glue serverlos ist. Amazon EMR erfordert die Verwaltung von Clustern, was einen höheren Betriebsaufwand bedeutet als AWS Glue. AWS Lambda hat Beschränkungen hinsichtlich der Laufzeit und des Speichers, was es für die Verarbeitung von 1 TB Daten ungeeignet macht. Amazon Redshift ist ein Data Warehouse und nicht primär für die Extraktion und Transformation von Daten aus verschiedenen Quellen in S3 konzipiert; es würde auch zusätzliche Schritte erfordern, um die Daten nach S3 zu verschieben, anstatt sie direkt dorthin zu laden.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich