Ein Unternehmen hat 10–15 TB unkomprimierte .csv-Dateien in Amazon S3 und plant eine einmalige Auswertung mit Amazon Athena. Das Unternehmen möchte die Daten transformieren, um Abfragezeiten zu verkürzen und Speicherkosten zu senken. Welche Dateiformat- und Komprimierungswahl erfüllt diese Anforderungen für Athena-Abfragen am besten?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Apache Parquet-Format, komprimiert mit Snappy.
Warum dies die Antwort ist
Apache Parquet ist ein spaltenorientiertes Format, das Athena-Abfragen erheblich beschleunigt, da es nur die benötigten Spalten liest. Dies reduziert auch die Menge der gescannten Daten und somit die Kosten. Snappy ist ein schneller Kompressions-Codec, der eine gute Balance zwischen Kompressionsrate und Dekompressionsgeschwindigkeit bietet, was ideal für Athena ist. CSV mit ZIP ist zeilenorientiert und ZIP ist kein Splittable-Format, was die Parallelisierung in Athena behindert. JSON mit bzip2 ist ebenfalls zeilenorientiert und bzip2 ist zwar splittable, aber langsamer als Snappy. Avro ist ein zeilenbasiertes Format, und LZO ist zwar splittable, aber Parquet bietet aufgrund seiner Spaltenorientierung bessere Leistung für analytische Abfragen.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich