Bir ML mühendisinin, iki iş yükü için Amazon Athena kullanan bir işlem hattı oluşturması gerekiyor: büyük ölçekli toplu dönüşümler ve model eğitimi ile çıkarım ve analizler için neredeyse gerçek zamanlı düşük gecikmeli sorgular. Hem toplu hem de neredeyse gerçek zamanlı işleme için EN DÜŞÜK gecikmeyi hangi dosya formatı sağlayacaktır?
Bir cevap seçin
Cevabınızı kontrol etmek için bir seçeneğe dokunun.
Doğru cevap: Apache Parquet.
Neden bu cevap
Apache Parquet, sütun tabanlı bir depolama formatıdır ve büyük veri kümelerinde analitik sorgular için optimize edilmiştir. Sütun tabanlı yapısı sayesinde, sorgular yalnızca ihtiyaç duyulan sütunları okuyarak I/O maliyetini ve gecikmeyi önemli ölçüde azaltır. Bu, hem toplu dönüşümler hem de düşük gecikmeli, neredeyse gerçek zamanlı sorgular için idealdir. CSV, satır tabanlıdır ve tüm satırın okunmasını gerektirir, bu da analitik sorgularda daha yüksek gecikmeye neden olur. Nested JSON ve Deserialized JSON da satır tabanlıdır ve Parquet'in sağladığı sütun tabanlı okuma avantajına sahip değildir, bu da onları düşük gecikmeli senaryolar için daha az uygun hale getirir.
Sonsuz cevap arayışı olmadan sınavınızı geçin
Bu sınav için her doğrulanmış soruyu ve açıklamayı tek bir yerde edinin ve saatlerce süren hazırlıktan tasarruf edin. 1.000'den fazla sertifika · 20'den fazla dil · ücretsiz başlayın.
Sınavınızı daha hızlı geçin → Kart gerekmez