Google PDE: Analytics com BigQuery e Engenharia de Data Warehouse — Guia de estudos

Faz parte do Google Professional Data Engineer — Guia de estudos. Pratique com respostas verificadas no centro de exames da Google, ou faça testes cronometrados no ExamRoll.io.

Visão Geral

O BigQuery é um data warehouse analítico serverless, colunar e MPP (Massively Parallel Processing) que separa o armazenamento da computação, oferecendo escala quase infinita, SQL padrão ANSI e governança integrada. A engenharia de warehouse no BigQuery equilibra o design do schema (particionamento, clustering, desnormalização vs. normalização, registros aninhados), padrões de ingestão (cargas em lote, streaming, Storage Write API) e gerenciamento de cargas de trabalho (edições sob demanda vs. baseadas em capacidade e reservas). Segurança robusta (views autorizadas, políticas de linha/coluna, tags de política) coexiste com controles de custo e ferramentas de performance para minimizar os bytes lidos e reduzir a latência. Esta seção aborda o design principal, as operações e os modos de falha que você deve antecipar em produção.

Armazenamento e Semântica: Datasets, Tabelas, Views e Acesso ao Lake

Otimização de Consultas e Gerenciamento de Carga de Trabalho

undefined

Ingestão, Federação e Recuperação

Segurança, Governança e Controle de Custos

undefined

e

undefined

. Armazene features em tabelas particionadas e use retreinamento agendado.

undefined

apenas para as colunas necessárias; evite

undefined

. - Use visualizações materializadas e cache de resultados quando aplicável. - Defina

undefined

para limitar o custo.

undefined

e rótulos de job detalhados para repassar custos e identificar outliers.

Cenário de Problema Prático

A NovaCare Health opera uma plataforma regional de telemedicina. Um design de tabela única,

undefined

, deu suporte a um piloto, mas com uma escala 100 vezes maior, os relatórios expiram (timeout), duplicatas aparecem de upserts de streaming e os parceiros exigem isolamento de dados rigoroso.

Abordagem:

  1. Redesenhar o esquema e o layout
    • Crie tabelas principais normalizadas:

undefined

e

undefined

.

undefined

em uma tabela particionada por

undefined

, clusterizada por

undefined

e

undefined

. Mantenha pequenas dimensões de referência desnormalizadas dentro de

undefined

para acelerar os dashboards.

undefined

, reduzindo o shuffle.

  1. Ingerir com a Storage Write API e garantir a idempotência

    • Use um pipeline do Dataflow para analisar eventos de entrada, validar e gravar em streams nomeados na Storage Write API com offsets idempotentes.
    • Encaminhe eventos malformados para uma tabela de dead-letter do BigQuery para triagem.
    • Justificativa: A Storage Write API oferece maior throughput, menor latência e melhores garantias de desduplicação do que o streaming legado. O uso de dead-lettering preserva a visibilidade sobre problemas de qualidade dos dados dos parceiros.
  2. Projetar para atualidade dos dados e desduplicação nas consultas

    • Para análises interativas, adicione um watermark curto (por exemplo, 2x a disponibilidade observada) antes de consultar a partição mais recente; ou filtre por

undefined

onde

undefined

para excluir linhas em trânsito.

undefined

em visualizações que devem tolerar novas tentativas (retries) do upstream.

  1. Acelerar agregações comuns com visualizações materializadas
    • Crie MVs alinhadas à partição sobre a tabela

undefined

para KPIs diários agrupados por

undefined

e coortes de pacientes. Garanta que os predicados sejam compatíveis com a reescrita.

  1. Impor isolamento de tenant e segurança detalhada
    • Coloque cada parceiro em um dataset dedicado. Conceda papéis de menor privilégio no nível do dataset aos grupos de parceiros.
    • Publique visualizações autorizadas para benchmarks compartilhados entre parceiros sem revelar as tabelas brutas.
    • Aplique tags de política a colunas de PII e adicione políticas de acesso a linhas na tabela

undefined

para restringir o acesso por

undefined

para análises internas multitenant.

  1. Gerenciar cargas de trabalho com edições, reservas e autoscaling
    • Adquira capacidade nas edições do BigQuery e crie duas reservas:

undefined

(para sinks do Dataflow, transformações agendadas) e

undefined

(para consultas ad hoc/relatórios). Atribua os projetos de acordo e habilite o autoscaling para absorver picos.

undefined

para projetos interativos.

  1. Governar custos e observar o uso
    • Exija filtros em

undefined

; rejeite

undefined

em visualizações compartilhadas. Use

undefined

para detectar varreduras não eliminadas e joins com distorção.

undefined

para acionar alertas de monitoramento para picos inesperados.

  1. Planejar recuperação e backfills

    • Habilite políticas de expiração de tabela padrão que se alinhem com as necessidades de conformidade e time-travel. Para grandes edições, crie um snapshot, execute as alterações e reverta rapidamente, se necessário. Use clones de tabela para análises de cenário (‘what-if’) em dev/test sem duplicar o armazenamento.
    • Justificativa: Snapshots e clones fornecem redes de segurança rápidas e eficientes em termos de espaço; o time-travel cobre pequenas restaurações corretivas.
  2. Integrar ML no próprio warehouse

    • Armazene features de engenharia em tabelas particionadas e treine modelos de classificação do BigQuery ML para risco de readmissão. Para modelos externos hospedados no Vertex AI, crie modelos remotos e armazene as predições em cache em uma tabela clusterizada para joins de baixa latência.
    • Justificativa: Manter o ML próximo aos dados reduz a movimentação e a complexidade da governança; o cache da inferência remota amortiza a latência e o custo.

Com este design, a NovaCare alcança um desempenho previsível sob uma carga 100 vezes maior, forte isolamento de tenant e custos governados, ao mesmo tempo que preserva análises de baixa latência e recuperação reprodutível.


Armazenamento de Dados · Todos os domínios · Processamento de Streams com Dataflow e Apache Beam

Pratique estas questões → · Prática cronometrada no ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Passe no seu exame →

Navegar Google →

Related guides

Acesso completo

Uma assinatura. Todos os exames.

Todo plano desbloqueia pesquisa ilimitada de respostas, testes práticos, explicações de AI e a biblioteca completa de recursos — em mais de 20 idiomas.

Mensal
24.87
Just €0.83/day
Tudo incluído:
  • Pesquisa ilimitada de respostas
  • Testes práticos ilimitados
  • Explicações com AI
  • Biblioteca completa de recursos
  • Mais de 20 idiomas
  • Atualizações semanais de conteúdo
  • Recompensas e indicações
  • Suporte prioritário
Iniciar teste grátis

*Não é necessário cartão de crédito

Melhor custo-benefício
12 meses
179.87
Just €0.49/daySave 40%
Tudo incluído:
  • Pesquisa ilimitada de respostas
  • Testes práticos ilimitados
  • Explicações com AI
  • Biblioteca completa de recursos
  • Mais de 20 idiomas
  • Atualizações semanais de conteúdo
  • Recompensas e indicações
  • Suporte prioritário
Iniciar teste grátis

*Não é necessário cartão de crédito

✓ Plano gratuito incluído · ✓ Cancele a qualquer momento · ✓ Todos os planos desbloqueiam o produto completo