Um job do Dataflow que ingere arquivos de texto compactados com gzip usa SideInputs para unir dados e grava erros em uma fila de mensagens mortas (dead-letter queue), mas o tempo de execução do job é maior do que o esperado. Qual alteração acelera o pipeline?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Usar CoGroupByKey em vez de SideInput..
Por que esta é a resposta
A opção correta é "Usar CoGroupByKey em vez de SideInput". SideInputs são eficientes para dados pequenos que cabem na memória de cada worker, mas para grandes volumes de dados, eles podem causar gargalos de desempenho, pois os dados precisam ser transmitidos para todos os workers. CoGroupByKey é uma transformação mais adequada para unir grandes conjuntos de dados, pois distribui a união de forma escalável entre os workers. Mudar os arquivos de entrada para Avro compactado pode melhorar a eficiência de leitura, mas não resolve o problema fundamental de desempenho na união de dados. Reduzir o tamanho do lote pode impactar a latência, mas não necessariamente o tempo total de execução para grandes volumes. Repetir registros com erro não acelera o pipeline, apenas altera o tratamento de erros.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão