Petabayt ölçeğinde bir veri kümesi üzerinde, küme altyapısını yönetmeden, yalnızca çalıştırdığınız sorgular için ödeme yaparak ve bir Jupyter not defterinden Python ile analiz yazarak keşifsel veri analizi (EDA) yapmanız gerekiyor. Bu kısıtlamaları hangi çözüm karşılar?
Bir cevap seçin
Cevabınızı kontrol etmek için bir seçeneğe dokunun.
Doğru cevap: Amazon Athena içinden Apache Spark çalıştırma..
Neden bu cevap
Doğru cevap, Amazon Athena içinden Apache Spark çalıştırmaktır. Athena, sunucusuz bir sorgu hizmetidir ve petabayt ölçeğindeki veriler üzerinde SQL sorguları çalıştırmanıza olanak tanır. Son zamanlarda, Athena'nın yerel Spark motoru desteği sayesinde, Jupyter defterlerinden Python ile Spark iş yüklerini doğrudan Athena üzerinden çalıştırabilirsiniz. Bu, altyapı yönetimi gerektirmeden, yalnızca çalıştırdığınız sorgular için ödeme yaparak EDA yapma kısıtlamalarını karşılar. Diğer seçenekler neden yanlış: Amazon SageMaker içinden Apache Spark çalıştırma, SageMaker'ın yönetilen bir hizmet olmasına rağmen, Spark için ayrı bir küme veya işleme ortamı gerektirir ve bu da altyapı yönetimi kısıtlamasını tam olarak karşılamaz. Sağladığınız bir Amazon EMR kümesinde Apache Spark çalıştırma, açıkça bir küme altyapısı yönetimi gerektirir ve bu da sorudaki "küme altyapısını yönetmeden" kısıtlamasına aykırıdır. Amazon Redshift ile entegre Apache Spark kullanma, Redshift'in bir veri ambarı hizmeti olması ve Spark entegrasyonunun genellikle Redshift kümesinin yönetimi ve maliyetleriyle birlikte gelmesi nedeniyle, sunucusuz ve yalnızca sorgu başına ödeme modeline tam olarak uymaz.
Sonsuz cevap arayışı olmadan sınavınızı geçin
Bu sınav için her doğrulanmış soruyu ve açıklamayı tek bir yerde edinin ve saatlerce süren hazırlıktan tasarruf edin. 1.000'den fazla sertifika · 20'den fazla dil · ücretsiz başlayın.
Sınavınızı daha hızlı geçin → Kart gerekmez