Bir ML mühendisinin, merkezi bir S3 bucket'ında depolanan binlerce mevcut CSV dosyasını ve yeni CSV yüklemelerini işlemesi gerekmektedir. Tüm CSV'ler aynı sütun düzenine sahiptir ve sorgulanması gereken bir işlem tarihi sütunu içerir. Bu durumu en az operasyonel yük ile hangi çözüm sağlar?
Bir cevap seçin
Cevabınızı kontrol etmek için bir seçeneğe dokunun.
Doğru cevap: S3 verileri üzerinde bir tablo (işlem tarihine göre bölümlenmiş veya filtrelenmiş) oluşturmak için bir Amazon Athena CREATE TABLE AS SELECT (CTAS) çalıştırmak, ardından bu tabloyu sorgulamak..
Neden bu cevap
Doğru cevap, Amazon Athena'nın S3'teki mevcut CSV dosyaları üzerinde doğrudan sorgulama yapabilmesi ve CTAS ile işlem tarihine göre bölümlenmiş veya filtrelenmiş bir tablo oluşturarak sorgu performansını optimize etmesidir. Bu yaklaşım, veriyi başka bir yere taşımadan veya karmaşık ETL süreçleri uygulamadan en düşük operasyonel yükü sağlar. S3 Object Lambda, veriyi sorgulamak yerine S3 nesnelerini okurken dönüştürmek için kullanılır. AWS Glue for Apache Spark işi, veriyi dönüştürmek ve yeni bir S3 bucket'ına yazmak için daha fazla operasyonel yük ve maliyet gerektirir. Amazon Kinesis Data Firehose, gerçek zamanlı veri akışlarını yönetmek için tasarlanmıştır ve mevcut binlerce dosyayı işlemek için en uygun çözüm değildir; ayrıca Firehose içinde sorgulama yapmak için Lambda kullanmak karmaşıklığı artırır.
Sonsuz cevap arayışı olmadan sınavınızı geçin
Bu sınav için her doğrulanmış soruyu ve açıklamayı tek bir yerde edinin ve saatlerce süren hazırlıktan tasarruf edin. 1.000'den fazla sertifika · 20'den fazla dil · ücretsiz başlayın.
Sınavınızı daha hızlı geçin → Kart gerekmez