Você precisa verificar se duas saídas de tabela do BigQuery são idênticas, mas não há uma chave primária. Qual abordagem produzirá uma comparação confiável de tabela completa?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Use um cluster Dataproc e o conector BigQuery Hadoop para ler os dados de cada tabela e calcular um hash a partir de colunas que não sejam de timestamp da tabela após a ordenação. Compare os hashes de cada tabela..
Por que esta é a resposta
A abordagem correta envolve o uso de um cluster Dataproc para ler os dados de ambas as tabelas do BigQuery. Ao ordenar os dados e calcular um hash a partir das colunas (excluindo timestamps, que podem variar ligeiramente), você cria uma "impressão digital" única para cada tabela. Se os hashes forem idênticos, as tabelas são consideradas iguais. Amostragem aleatória (com RAND() ou HASH() para seleção, ou amostragem estratificada com OVER()) não garante uma comparação completa e confiável. Amostras podem ser idênticas mesmo que as tabelas completas não sejam, ou vice-versa, devido à natureza probabilística da amostragem. A única forma de garantir a identidade é comparar todos os dados de forma determinística.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão