Você migrou arquivos ORC para um bucket do Cloud Storage e quer usar o Hive em um cluster Dataproc, replicando dados opcionalmente para o HDFS para melhorar o desempenho. Quais são os dois métodos que permitem começar a usar o Hive no Dataproc? (Escolha duas.)
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Execute gsutil para transferir todos os arquivos ORC do bucket do Cloud Storage para o nó mestre, depois use os utilitários Hadoop para copiá-los para o HDFS e monte as tabelas Hive do HDFS, Use o conector do Cloud Storage para Hadoop para expor os arquivos ORC como tabelas Hive externas e, em seguida, replique essas tabelas externas para tabelas Hive nativas.
Por que esta é a resposta
A primeira opção correta descreve um método manual: transferir os arquivos ORC para o nó mestre do Dataproc usando gsutil e, em seguida, usar ferramentas Hadoop (como hadoop fs -put) para movê-los para o HDFS, onde o Hive pode acessá-los como tabelas gerenciadas. A replicação para HDFS é explícita aqui. A segunda opção correta utiliza o conector do Cloud Storage para Hadoop (GCS Connector), que permite ao Hive acessar diretamente os arquivos ORC no Cloud Storage como tabelas externas. Se a replicação para HDFS for desejada para desempenho, esses dados podem ser copiados para tabelas Hive nativas (gerenciadas) no HDFS. As opções incorretas envolvem transferências ineficientes ou desnecessárias (gsutil diretamente para HDFS não é a forma padrão), ou o uso de BigQuery, que não é o objetivo principal de usar Hive com arquivos ORC no Cloud Storage.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão