Bir veri bilimcisinin şirket içi bir ETL sürecini AWS'ye taşıması gerekiyor. Mevcut süreç belirli bir programa göre çalışır ve sonraki işler için birkaç büyük veri kaynağını tek bir birleştirilmiş çıktıya dönüştürmek ve biçimlendirmek için PySpark kullanır. Bulut çözümü için gereksinimler şunlardır: birden çok kaynağı birleştirmek, mevcut PySpark kodunu yeniden kullanmak, mevcut programa göre çalıştırmak ve yönetilecek sunucu sayısını en aza indirmek. Hangi mimari bu gereksinimleri karşılar?
Bir cevap seçin
Cevabınızı kontrol etmek için bir seçeneğe dokunun.
Doğru cevap: Ham verileri Amazon S3'te depolayın. Mevcut mantığı yeniden kullanmak için PySpark'ta uygulanan bir AWS Glue ETL işi oluşturun. Mevcut programa göre çalışacak bir AWS Glue tetikleyicisi yapılandırın ve işin işlenmiş çıktısını sonraki kullanım için Amazon S3'teki işlenmiş bir konuma yazmasını sağlayın..
Neden bu cevap
Doğru cevap, mevcut PySpark kodunu yeniden kullanma, programlı çalıştırma ve yönetilecek sunucu sayısını en aza indirme gereksinimlerini karşıladığı için AWS Glue'dur. AWS Glue, sunucusuz bir ETL hizmetidir ve PySpark kodunu doğrudan çalıştırabilir. Bir AWS Glue tetikleyicisi, işin belirli bir programa göre çalışmasını sağlar. Amazon EMR kalıcı bir küme gerektirir ve sunucu yönetimi içerir. AWS Lambda, PySpark'ı doğrudan çalıştırmak için uygun değildir ve PySpark mantığının Python'da yeniden yazılmasını gerektirir. Amazon Kinesis Data Analytics, akış verileri için tasarlanmıştır ve mevcut PySpark kodunu yeniden kullanma gereksinimini karşılamaz.
Bu sınav için her doğrulanmış soruyu ve açıklamayı tek bir yerde edinin ve saatlerce süren hazırlıktan tasarruf edin. 1.000'den fazla sertifika · 20'den fazla dil · ücretsiz başlayın.