10 GB boyutunda bir Amazon DynamoDB tablosunda IoT toprak sensörü verileriniz ve Amazon S3'te 5 GB JSON dosyaları olarak hava durumu olay verileriniz var. Bu birleşik veri kümesini en az yönetimsel yük ile bir Amazon SageMaker modeli eğitmek için hazırlamak istiyorsunuz. Gerekli dönüşümü en iyi şekilde hangi yaklaşım gerçekleştirir?
Bir cevap seçin
Cevabınızı kontrol etmek için bir seçeneğe dokunun.
Doğru cevap: Verileri kataloglamak için AWS Glue crawler'ları çalıştırın. DynamoDB ve S3 veri kümelerini birleştiren ve birleştirilmiş çıktıyı CSV dosyaları olarak Amazon S3'e yazan bir AWS Glue ETL işi oluşturun..
Neden bu cevap
Bu senaryoda en az yönetimsel yük ile veri hazırlığı için AWS Glue en uygun çözümdür. AWS Glue crawler'ları, DynamoDB ve S3'teki verilerin şemasını otomatik olarak algılar ve AWS Glue Data Catalog'a kaydeder. Bu, veri kaynaklarına kolayca erişilmesini sağlar. Ardından, bir AWS Glue ETL işi, Python veya Scala kullanarak bu iki veri kümesini birleştirebilir ve bir SageMaker modelini eğitmek için uygun olan CSV formatında Amazon S3'e yazabilir. Bu yaklaşım sunucusuzdur (serverless), bu da altyapı yönetimi yükünü ortadan kaldırır. Diğer seçenekler neden uygun değil: Amazon EMR: Yönetilmesi gereken bir küme gerektirir ve bu da yönetimsel yükü artırır. AWS Glue ETL işini Amazon Redshift'e yazmak: Redshift bir veri ambarıdır ve bu senaryoda doğrudan SageMaker eğitimi için ara bir adım olarak gereksiz bir ek yönetim yükü ve maliyet getirir. DynamoDB Streams ve Lambda: Sürekli akış işleme için daha uygundur ve mevcut S3 dosyalarına ekleme yapmak karmaşık bir Lambda mantığı gerektirir, bu da yönetimsel yükü artırabilir.
Sonsuz cevap arayışı olmadan sınavınızı geçin
Bu sınav için her doğrulanmış soruyu ve açıklamayı tek bir yerde edinin ve saatlerce süren hazırlıktan tasarruf edin. 1.000'den fazla sertifika · 20'den fazla dil · ücretsiz başlayın.
Sınavınızı daha hızlı geçin → Kart gerekmez