U hebt ORC-bestanden gemigreerd naar een Cloud Storage-bucket en wilt Hive gebruiken op een Dataproc-cluster, waarbij u optioneel gegevens repliceert naar HDFS voor prestaties. Welke twee methoden laten u Hive op Dataproc gebruiken? (Kies twee.)
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Voer gsutil uit om alle ORC-bestanden van de Cloud Storage-bucket naar het hoofdknooppunt over te zetten, gebruik vervolgens Hadoop-hulpprogramma's om ze naar HDFS te kopiëren en de Hive-tabellen vanuit HDFS te koppelen, Gebruik de Cloud Storage connector voor Hadoop om de ORC-bestanden als externe Hive-tabellen beschikbaar te maken, en repliceer die externe tabellen vervolgens naar native Hive-tabellen.
Waarom dit het antwoord is
De eerste correcte methode is om de ORC-bestanden van Cloud Storage naar het Dataproc-hoofdknooppunt te kopiëren met gsutil, en vervolgens Hadoop-hulpprogramma's (zoals hadoop fs -put of hdfs dfs -put) te gebruiken om ze naar HDFS te verplaatsen. Hierdoor kunnen Hive-tabellen de gegevens rechtstreeks vanuit HDFS benaderen, wat de prestaties kan verbeteren door lokale opslag. De tweede correcte methode is om de Cloud Storage connector voor Hadoop te gebruiken. Deze connector stelt Hive in staat om externe tabellen te definiëren die rechtstreeks naar de ORC-bestanden in Cloud Storage verwijzen. Voor prestatieverbetering kunnen deze externe tabellen vervolgens worden gerepliceerd naar native Hive-tabellen die de gegevens in HDFS opslaan. De optie om gsutil te gebruiken om bestanden rechtstreeks naar HDFS over te zetten is onjuist, omdat gsutil niet direct met HDFS kan communiceren; het is een tool voor Cloud Storage. Het overzetten van bestanden naar een willekeurig Dataproc-knooppunt in plaats van specifiek het hoofdknooppunt is minder efficiënt en niet de standaardprocedure voor het laden van gegevens in HDFS voor Hive. Het laden van bestanden in BigQuery en vervolgens de BigQuery connector gebruiken is een omweg en niet de meest directe of efficiënte manier om ORC-bestanden van Cloud Storage naar Hive op Dataproc te krijgen, vooral als het doel is om de bestanden in HDFS te repliceren.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig