Um trabalho Hadoop com uso intensivo de I/O de disco é executado muito mais lentamente no Dataproc usando o Cloud Storage para intermediários do que em um HDFS bare-metal on-prem. Como você corrige isso enquanto separa o armazenamento e a computação?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Provisione mais disco persistente e mantenha os dados intermediários desse trabalho no HDFS nativo.
Por que esta é a resposta
A opção correta é provisionar mais disco persistente e manter os dados intermediários no HDFS nativo. Isso ocorre porque, para cargas de trabalho intensivas em I/O de disco, o HDFS nativo no disco local oferece latência e throughput significativamente melhores do que o Cloud Storage para dados intermediários. O Cloud Storage é otimizado para armazenamento durável e de baixo custo, não para o desempenho de I/O de alta velocidade exigido por dados intermediários de jobs Hadoop. Dar mais memória ao cluster (RAM) não resolverá o problema, pois os dados intermediários geralmente excedem a capacidade da RAM e são persistidos em disco. Aumentar os núcleos da CPU da VM não melhora diretamente o desempenho de I/O de disco. Adicionar NICs extras e usar agregação de link não impacta o desempenho de I/O de disco local, apenas a largura de banda da rede, que não é o gargalo principal para dados intermediários em jobs intensivos em I/O.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão