Os fluxos de dados de rastreamento de pacotes para o BigQuery; a tabela é particionada por data de ingestão e os tempos de consulta aumentaram. Para copiar dados para uma nova tabela clusterizada para análise do ciclo de vida geoespacial, em que você deve clusterizar?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Implementar o clustering no BigQuery na coluna de ID de rastreamento do pacote..
Por que esta é a resposta
A opção correta é clusterizar na coluna de ID de rastreamento do pacote. O clustering organiza fisicamente os dados dentro de cada partição com base nos valores da coluna clusterizada, melhorando o desempenho de consultas que filtram ou agregam por essa coluna. Como a análise é sobre o ciclo de vida geoespacial, o ID de rastreamento é a chave primária para identificar e agrupar todos os eventos relacionados a um pacote específico, tornando-o ideal para otimizar essas consultas. Recriar a tabela com particionamento por data de entrega não resolveria o problema de desempenho para consultas que precisam analisar o ciclo de vida completo de um pacote, pois a data de entrega pode ser muito posterior à data de ingestão e não agruparia todos os eventos de um mesmo pacote. Clusterizar pela data de ingestão seria redundante com o particionamento existente e não otimizaria as consultas por ID de rastreamento. Armazenar dados antigos no Cloud Storage e usar uma tabela externa adicionaria latência e complexidade, sem otimizar o desempenho das consultas no BigQuery.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão