Ha migrado archivos ORC a un bucket de Cloud Storage y desea utilizar Hive en un clúster de Dataproc, replicando opcionalmente los datos en HDFS para mejorar el rendimiento. ¿Qué dos métodos le permiten comenzar a usar Hive en Dataproc? (Elija dos)
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Ejecute gsutil para transferir todos los archivos ORC del bucket de Cloud Storage al nodo maestro, luego use las utilidades de Hadoop para copiarlos en HDFS y monte las tablas de Hive desde HDFS., Utilice el conector de Cloud Storage para Hadoop para exponer los archivos ORC como tablas externas de Hive y luego replique esas tablas externas en tablas nativas de Hive..
Por qué esta es la respuesta
La opción de usar gsutil para transferir archivos al nodo maestro y luego copiarlos a HDFS con utilidades de Hadoop es correcta porque permite la replicación directa de los datos en HDFS, lo que mejora el rendimiento de Hive. La opción de usar el conector de Cloud Storage para Hadoop es correcta porque permite que Hive acceda directamente a los archivos ORC en Cloud Storage como tablas externas. Luego, estas tablas externas se pueden replicar en tablas nativas de Hive en HDFS para un rendimiento óptimo. La primera opción incorrecta de transferir archivos directamente a HDFS con gsutil no es posible, ya que gsutil no interactúa directamente con HDFS. La segunda opción incorrecta de transferir archivos a cualquier nodo de Dataproc y montar tablas localmente no es escalable ni eficiente para Hive en un clúster. La última opción incorrecta de cargar en BigQuery y usar su conector es una solución indirecta y no aborda la replicación de datos ORC en HDFS para Hive.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta