Um job do Dataproc Spark com muitos shuffles lê arquivos parquet de ~200–400 MB cada e é executado em workers preemptivos com apenas dois nós não preemptivos. Para melhorar o desempenho de forma econômica, qual alteração você deve fazer?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Mudar de HDDs para SSDs, substituir a configuração das VMs preemptivas para aumentar o tamanho do disco de boot..
Por que esta é a resposta
A opção correta é mudar de HDDs para SSDs e aumentar o tamanho do disco de boot nas VMs preemptivas. Jobs Spark com muitos shuffles são intensivos em I/O e se beneficiam enormemente da velocidade dos SSDs. O disco de boot é onde o HDFS armazena os dados temporários e de shuffle. Aumentar seu tamanho e usar SSDs reduzirá gargalos de I/O, melhorando o desempenho e a estabilidade, especialmente em workers preemptivos que podem ser reiniciados. Aumentar o tamanho dos arquivos Parquet para 1 GB pode ser benéfico para o desempenho geral do Spark, mas não aborda diretamente o problema de I/O intensivo de shuffle em workers preemptivos com HDDs. Mudar para TFRecords não é uma melhoria, pois Parquet já é um formato otimizado para Spark. Copiar dados para HDFS em SSDs e depois de volta para GCS adiciona complexidade e tempo de processamento desnecessários, sendo menos eficaz do que otimizar o disco de boot diretamente.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão