Amazon Athena sorgularını hızlandırmak için bir veri mühendisi, tüm girdi dosyalarının sıkıştırılmamış .csv olduğunu ve çoğu sorgunun tek bir sütun seçtiğini fark eder. Hangi değişiklik Athena sorgu performansını EN ÇOK artırır?
Bir cevap seçin
Cevabınızı kontrol etmek için bir seçeneğe dokunun.
Doğru cevap: Veri formatını .csv'den Apache Parquet'e değiştirin. Snappy sıkıştırması uygulayın..
Neden bu cevap
Veri formatını .csv'den Apache Parquet'e değiştirmek ve Snappy sıkıştırması uygulamak, Athena sorgu performansını en çok artırır. Bunun nedeni, Parquet'in sütun tabanlı bir depolama formatı olmasıdır. Sütun tabanlı depolama, yalnızca sorgulanan sütunların okunmasını sağlayarak I/O maliyetini önemli ölçüde azaltır. Ayrıca, Parquet formatı, Snappy gibi sıkıştırma algoritmalarıyla birlikte kullanıldığında daha verimli sıkıştırma ve daha hızlı veri okuma sağlar. Diğer seçenekler neden daha az etkilidir: .csv dosyalarını JSON'a dönüştürmek ve Snappy ile sıkıştırmak: JSON satır tabanlı bir format olduğu için sütun tabanlı okuma avantajı sağlamaz. Mevcut .csv dosyalarına Snappy sıkıştırması uygulamak: Sıkıştırma faydalı olsa da, .csv satır tabanlı kaldığı için sütun tabanlı okuma avantajını sunmaz. .csv dosyalarını gzip sıkıştırması kullanarak sıkıştırmak: Gzip iyi bir sıkıştırma oranı sunsa da, genellikle Snappy'den daha yavaş sıkıştırma ve açma hızına sahiptir ve yine sütun tabanlı okuma avantajı sağlamaz.
Sonsuz cevap arayışı olmadan sınavınızı geçin
Bu sınav için her doğrulanmış soruyu ve açıklamayı tek bir yerde edinin ve saatlerce süren hazırlıktan tasarruf edin. 1.000'den fazla sertifika · 20'den fazla dil · ücretsiz başlayın.
Sınavınızı daha hızlı geçin → Kart gerekmez