ORC dosyalarını bir Cloud Storage paketine taşıdınız ve isteğe bağlı olarak performans için verileri HDFS'ye kopyalayarak bir Dataproc kümesinde Hive kullanmak istiyorsunuz. Dataproc üzerinde Hive kullanmaya başlamanızı sağlayacak iki yöntem hangileridir? (İki tane seçin.)
Bir cevap seçin
Cevabınızı kontrol etmek için bir seçeneğe dokunun.
Doğru cevap: Tüm ORC dosyalarını Cloud Storage paketinden ana düğüme aktarmak için gsutil komutunu çalıştırın, ardından bunları HDFS'ye kopyalamak için Hadoop yardımcı programlarını kullanın ve Hive tablolarını HDFS'den bağlayın, ORC dosyalarını harici Hive tabloları olarak göstermek için Hadoop için Cloud Storage bağlayıcısını kullanın ve ardından bu harici tabloları yerel Hive tablolarına kopyalayın.
Neden bu cevap
İlk doğru seçenek, gsutil ile dosyaları ana düğüme kopyalamayı ve ardından hadoop fs -put gibi komutlarla HDFS'ye taşımayı içerir. Bu, verileri HDFS'ye aktarmanın ve Hive'ın yerel olarak HDFS'den okumasını sağlamanın standart bir yoludur. İkinci doğru seçenek, Cloud Storage bağlayıcısını kullanarak ORC dosyalarını doğrudan Cloud Storage'dan harici Hive tabloları olarak göstermeyi ve ardından bu verileri INSERT OVERWRITE gibi Hive komutlarıyla HDFS'deki yönetilen tablolara kopyalamayı açıklar. Bu, Cloud Storage'daki verileri doğrudan kullanıp ardından performans için HDFS'ye almanın etkili bir yoludur. Diğer seçenekler ya gsutil ile doğrudan HDFS'ye aktarımın mümkün olmaması (yalnızca yerel dosya sistemine kopyalar) ya da BigQuery'nin Hive ile doğrudan entegrasyonunun bu senaryo için uygun olmaması nedeniyle yanlıştır.
Sonsuz cevap arayışı olmadan sınavınızı geçin
Bu sınav için her doğrulanmış soruyu ve açıklamayı tek bir yerde edinin ve saatlerce süren hazırlıktan tasarruf edin. 1.000'den fazla sertifika · 20'den fazla dil · ücretsiz başlayın.
Sınavınızı daha hızlı geçin → Kart gerekmez