Bir şirketin, karışık dosya türleri (CSV, JSON, XLSX ve Apache Parquet) içeren bir S3 klasörü bulunmaktadır. Bir ML mühendisi, verileri işlemek için AWS Glue DataBrew kullanacak ve nihai çıktıyı daha sonra AWS Glue'nun tüketebilmesi için S3'e geri kaydetmesi gerekmektedir. Hangi yaklaşım bu gereksinimleri karşılar?
Bir cevap seçin
Cevabınızı kontrol etmek için bir seçeneğe dokunun.
Doğru cevap: Dosyaları dosya türüne göre ayrı klasörlere ayırın, her klasörü DataBrew ile işleyin ve çıktıları Apache Parquet formatında yazın..
Neden bu cevap
Doğru cevap, farklı dosya türlerinin ayrı ayrı işlenmesi gerektiğini belirtir. AWS Glue DataBrew, tek bir veri kümesi kaynağında birden fazla dosya türünü doğrudan işleyemez. Her dosya türü için ayrı bir DataBrew veri kümesi oluşturulmalı ve işlenmelidir. Çıktı olarak Apache Parquet formatının seçilmesi, AWS Glue'nun daha sonra verileri verimli bir şekilde tüketmesi için optimize edilmiş, sütunlu bir depolama formatı olduğundan en iyi uygulamadır. "AWS Glue Parquet formatı" diye özel bir format yoktur; Parquet, AWS Glue tarafından desteklenen standart bir formattır. Diğer seçenekler, DataBrew'un karışık dosya türlerini tek bir işlemde işleyememesi veya gereksiz yere "AWS Glue Parquet" gibi yanlış bir format belirtmesi nedeniyle yanlıştır.
Sonsuz cevap arayışı olmadan sınavınızı geçin
Bu sınav için her doğrulanmış soruyu ve açıklamayı tek bir yerde edinin ve saatlerce süren hazırlıktan tasarruf edin. 1.000'den fazla sertifika · 20'den fazla dil · ücretsiz başlayın.
Sınavınızı daha hızlı geçin → Kart gerekmez