Um Amazon Athena-Abfragen zu beschleunigen, stellt ein Dateningenieur fest, dass alle Eingabedateien unkomprimierte .csv-Dateien sind und die meisten Abfragen eine einzelne Spalte auswählen. Welche Änderung würde die Athena-Abfrageleistung AM MEISTEN verbessern?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Ändern Sie das Datenformat von .csv in Apache Parquet. Wenden Sie die Snappy-Komprimierung an..
Warum dies die Antwort ist
Die Umwandlung von CSV in Apache Parquet mit Snappy-Komprimierung verbessert die Athena-Abfrageleistung am meisten. Parquet ist ein spaltenorientiertes Format, das für analytische Abfragen optimiert ist. Da die meisten Abfragen nur eine einzelne Spalte auswählen, liest Parquet nur die benötigten Spalten, was die I/O-Vorgänge erheblich reduziert. Snappy bietet eine gute Balance zwischen Komprimierungsrate und Dekomprimierungsgeschwindigkeit. Die Konvertierung in JSON ist weniger effizient, da JSON ein zeilenbasiertes Format ist und nicht die spaltenorientierten Vorteile von Parquet bietet. Das Anwenden von Snappy-Komprimierung auf CSV-Dateien oder die Verwendung von GZIP würde zwar die Datenmenge reduzieren, aber CSV bleibt ein zeilenbasiertes Format, das bei spaltenselektiven Abfragen weiterhin alle Daten einer Zeile lesen muss.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich