Ein Dateningenieur muss strukturierte .csv-Dateien (15 Spalten) in einen Amazon S3 Data Lake laden. Analysten führen Amazon Athena-Abfragen aus, die typischerweise nur ein oder zwei Spalten referenzieren und selten die gesamte Datei scannen. Welcher Ansatz ist am kostengünstigsten?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Erstellen Sie einen AWS Glue ETL-Job (Extract, Transform, and Load), um aus der strukturierten .csv-Datenquelle zu lesen. Konfigurieren Sie den Job so, dass er die Daten im Apache Parquet-Format in den Data Lake schreibt..
Warum dies die Antwort ist
Die Umwandlung der Daten in das Apache Parquet-Format ist am kostengünstigsten, da Parquet ein spaltenorientiertes Format ist. Dies ist ideal für Abfragen, die nur wenige Spalten referenzieren, da Athena nur die benötigten Spalten lesen muss, was die gescannte Datenmenge und damit die Kosten reduziert. Parquet bietet auch eine effiziente Komprimierung und ist splittbar, was die Leistung von Athena weiter verbessert. Die Aufnahme im .csv-Format (Option 1) ist teuer, da .csv ein zeilenorientiertes Format ist und Athena die gesamte Zeile scannen müsste, selbst wenn nur eine Spalte benötigt wird. JSON (Option 2) ist ebenfalls zeilenorientiert und weniger effizient für analytische Abfragen als Parquet. Apache Avro (Option 3) ist zwar ein binäres Format, aber primär zeilenorientiert, was es weniger effizient macht als Parquet für Abfragen, die nur Teilmengen von Spalten betreffen.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich