Bir şirket, SAP HANA, SQL Server, MongoDB, Kafka ve DynamoDB gibi kaynaklardan günde yaklaşık 1 TB veri çıkarıyor. Bazı kaynakların şemaları tanımsız veya gelişmekte. Çözüm, şemaları algılamalı, ETL gerçekleştirmeli ve verileri oluşturulduktan sonraki 15 dakika içinde S3'e yüklemelidir. En az operasyonel yük ile gerekli işlevselliği hangi yaklaşım sağlar?
Bir cevap seçin
Cevabınızı kontrol etmek için bir seçeneğe dokunun.
Doğru cevap: Şemayı algılamak ve verileri S3 bucket'ına ayıklamak, dönüştürmek ve yüklemek için AWS Glue kullanın. Apache Spark'ta bir pipeline oluşturun..
Neden bu cevap
AWS Glue, sunucusuz bir ETL hizmetidir ve şema algılama (Glue Crawler'lar aracılığıyla) ve veri dönüşümü için yönetilen Apache Spark ortamı sunar. Bu, operasyonel yükü en aza indirirken, farklı kaynaklardan gelen şemasız veya gelişen şemalı verileri işleme ve S3'e yükleme gereksinimini karşılar. Apache Spark'ta bir pipeline oluşturmak, büyük veri kümelerini verimli bir şekilde işlemek için ölçeklenebilirlik sağlar. Amazon EMR, Spark dahil birçok büyük veri çerçevesini destekler ancak yönetilen bir hizmet olmasına rağmen AWS Glue'dan daha fazla operasyonel yönetim gerektirir. AWS Lambda, kısa süreli ve daha küçük ölçekli işler için uygundur; günde 1 TB veri ve 15 dakikalık gecikme süresi için yeterli işlem gücü ve süresi sağlamakta zorlanabilir. Amazon Redshift'teki saklı yordamlar, Redshift'in kendi içindeki verileri işlemek için tasarlanmıştır ve doğrudan farklı kaynaklardan şema algılama ve ETL işlemleri için birincil araç değildir; ayrıca Redshift Spectrum, S3'teki verilere erişmek için kullanılır, verileri S3'e yüklemek için değil.
Sonsuz cevap arayışı olmadan sınavınızı geçin
Bu sınav için her doğrulanmış soruyu ve açıklamayı tek bir yerde edinin ve saatlerce süren hazırlıktan tasarruf edin. 1.000'den fazla sertifika · 20'den fazla dil · ücretsiz başlayın.
Sınavınızı daha hızlı geçin → Kart gerekmez