Yavaş çalışan bir PySpark toplu iş hattını sunucusuz, SQL tabanlı bir yaklaşımla yeniden oluşturmak istiyorsunuz. Ham veriler Cloud Storage'da bulunuyor. Geliştirme ve çalışma zamanını hızlandırmak için işlem hattını nasıl uygulamalısınız?
Bir cevap seçin
Cevabınızı kontrol etmek için bir seçeneğe dokunun.
Doğru cevap: Verileri Cloud Storage'dan BigQuery'ye yükleyin, PySpark dönüşümlerini BigQuery SQL'e çevirin ve sonuçları yeni bir BigQuery tablosuna yazın..
Neden bu cevap
Doğru seçenek, sunucusuz ve SQL tabanlı bir yaklaşım için en uygun olanıdır. Ham verileri Cloud Storage'dan doğrudan BigQuery'ye yüklemek, BigQuery'nin yönetilen depolama ve analiz yeteneklerinden yararlanmanızı sağlar. PySpark dönüşümlerini BigQuery SQL'e çevirmek, BigQuery'nin optimize edilmiş sorgu motorunu kullanarak performansı artırır ve sunucusuz bir deneyim sunar. Sonuçları yeni bir BigQuery tablosuna yazmak, verilerin daha fazla analiz veya makine öğrenimi için kolayca erişilebilir olmasını sağlar. Diğer seçenekler: PySpark komutlarını SparkSQL'e dönüştürüp Dataproc üzerinde çalıştırmak sunucusuz değildir ve yönetilmesi gereken bir küme gerektirir. Verileri Cloud SQL'e almak, büyük veri kümeleri için ölçeklenebilirlik ve maliyet açısından BigQuery'ye göre daha az verimlidir. Apache Beam Python SDK ile yeniden uygulama, PySpark'tan farklı bir programlama modeli gerektirir ve mevcut SQL tabanlı yaklaşıma geçişi zorlaştırır.
Sonsuz cevap arayışı olmadan sınavınızı geçin
Bu sınav için her doğrulanmış soruyu ve açıklamayı tek bir yerde edinin ve saatlerce süren hazırlıktan tasarruf edin. 1.000'den fazla sertifika · 20'den fazla dil · ücretsiz başlayın.
Sınavınızı daha hızlı geçin → Kart gerekmez