Google PDE: Armazenamento de Dados, Data Lakes e Formatos de Arquivo — Guia de estudos

Faz parte do Google Professional Data Engineer — Guia de estudos. Pratique com respostas verificadas no centro de exames da Google, ou faça testes cronometrados no ExamRoll.io.

Visão Geral

O armazenamento de dados no Google Cloud abrange desde o armazenamento de objetos brutos até data lakes curados e formatos otimizados para análise. A construção de lakes confiáveis, governados e de alto desempenho exige escolhas cuidadosas em classes de armazenamento, configurações de bucket, locais, formatos de arquivo, layout de tabela e ciclo de vida. Esta seção detalha os trade-offs de design, os modos de falha a serem evitados e os padrões que se alinham com o BigQuery, Spark e pipelines de streaming em grande escala.

Fundamentos do Cloud Storage: classes, buckets, consistência e ciclo de vida

O Cloud Storage é a base durável e de alta disponibilidade para arquivos brutos e curados.

Governança unificada de lake com BigLake e Dataplex

O BigLake e o Dataplex padronizam a segurança e a governança em arquivos e tabelas.

Formatos de arquivo, compressão e comportamento de consulta

A escolha do formato correto tem efeitos diretos no custo e no desempenho.

Layout, particionamento, engenharia de performance, residência e migração

undefined

Cenário de Problema Prático

A Acme Retail recebe entregas diárias de CSVs de um parceiro de logística em um bucket regional do Cloud Storage. Ocasionalmente, os arquivos contêm linhas malformadas. A Acme deve receber, validar, converter para um formato pronto para análise e carregar no BigQuery para dashboards quase em tempo real, enquanto retém as linhas inválidas para inspeção e aplica governança.

Abordagem:

  1. Receber e governar dados brutos no Dataplex

    • Crie um lake no Dataplex com um ativo de zona bruta (raw zone) mapeado para gs://acme-raw/logistics/.
    • Justificativa: Governança, metadados e linhagem centralizados. Aplicar IAM no nível da zona e marcar campos sensíveis com tags de política (policy tags) para aplicação downstream.
  2. Aplicar ciclo de vida e retenção

    • Aplique uma política de retenção de 30 dias no bucket e habilite o versionamento de objetos em acme-raw.
    • Justificativa: Protege contra sobrescrita/exclusão acidental pelo parceiro; a retenção curta equilibra custo e recuperabilidade. O versionamento facilita o rollback de entregas ruins.
  3. Validar e ingerir com um pipeline em lote do Dataflow

    • Acione um job diário do Dataflow com base em notificações de finalização de objeto. Leia o CSV com esquema e validação por registro; grave os registros válidos em uma área de preparação (staging) do BigQuery (particionada por event_date) e roteie os erros de análise/validação para uma tabela de mensagens mortas (dead-letter) do BigQuery.
    • Justificativa: O Dataflow fornece análise paralela escalável e tratamento robusto de mensagens mortas (dead-letter) para que os analistas possam inspecionar as linhas inválidas. Isso espelha a melhor prática para qualidade heterogênea de CSVs.
  4. Compactar e converter para Parquet na zona curada

    • O mesmo pipeline grava os dados validados em gs://acme-curated/logistics/date=YYYY-MM-DD/ como arquivos Parquet com tamanho de ~256–512 MB.
    • Justificativa: O Parquet permite a eliminação de colunas (column pruning) e o empurramento de predicados (predicate pushdown) no BigQuery e no Spark, reduzindo os bytes escaneados e melhorando a latência; a compactação mitiga a sobrecarga de arquivos pequenos do padrão de entrega do parceiro.
  5. Expor análises governadas via BigLake

    • Crie uma tabela externa do BigLake sobre o caminho do Parquet curado com particionamento automático do Hive; aplique tags de política no nível da coluna e políticas de acesso no nível da linha para filtros específicos do parceiro.
    • Justificativa: Acesso refinado e uniforme no BigQuery e no Spark com auditoria centralizada. A eliminação de partições (partition pruning) reduz os custos de escaneamento em filtros de data.
  6. Carregar agregados críticos para o BigQuery nativo

    • Para dashboards de acesso frequente (hot), execute um job agendado do BigQuery que ingere os últimos N dias da tabela externa de Parquet curado para uma tabela nativa particionada e clusterizada.
    • Justificativa: O armazenamento nativo acelera o BI de alta concorrência, enquanto a tabela externa do BigLake permanece como o sistema de registro (system-of-record) governado para um acesso mais amplo.
  7. Monitorar e alertar com Cloud Logging e Pub/Sub

    • Crie um coletor de logs (log sink) filtrando os resultados dos jobs de carregamento do Dataflow e do BigQuery para o Pub/Sub; integre com a ferramenta de monitoramento para alertas instantâneos sobre falhas ou taxas elevadas de linhas inválidas.
    • Justificativa: Visibilidade operacional direcionada e específica da tabela sem a necessidade de polling; dá suporte às práticas de SRE.
  8. Otimizar classe de armazenamento e residência

    • Mantenha o Parquet curado em Standard por 14 dias, transicione para Coldline após 30 dias via regra de ciclo de vida; armazene os buckets brutos e curados na mesma região que os datasets do BigQuery para evitar saída de dados (egress).
    • Justificativa: Equilibra o desempenho de leitura frequente (hot) com o custo. A colocalização mantém a conformidade e minimiza a latência e as taxas de saída de dados (egress).
  9. Validar a qualidade de ponta a ponta

    • Após cada execução, compare contagens e agregados de hash entre as tabelas de preparação (staging), externa curada e nativa do BigQuery; coloque anomalias em quarentena.
    • Justificativa: Detecção precoce de desvio de esquema (schema drift) ou regressões na ingestão; hashes criptográficos ou de impressão digital (fingerprint) fornecem uma garantia leve sem reescaneamentos completos.

Este design fornece uma ingestão resiliente com análise de mensagens mortas (dead-letter), Parquet pronto para análise para consultas eficientes, governança centralizada via Dataplex e BigLake e políticas de ciclo de vida otimizadas para custos, tudo isso aderindo ao acesso de privilégio mínimo e a operações auditáveis.


Arquitetura e Design de Engenharia de Dados · Todos os domínios · Analytics com BigQuery e Engenharia de Data Warehouse

Pratique estas questões → · Prática cronometrada no ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Passe no seu exame →

Navegar Google →

Related guides

Acesso completo

Uma assinatura. Todos os exames.

Todo plano desbloqueia pesquisa ilimitada de respostas, testes práticos, explicações de AI e a biblioteca completa de recursos — em mais de 20 idiomas.

Mensal
24.87
Just €0.83/day
Tudo incluído:
  • Pesquisa ilimitada de respostas
  • Testes práticos ilimitados
  • Explicações com AI
  • Biblioteca completa de recursos
  • Mais de 20 idiomas
  • Atualizações semanais de conteúdo
  • Recompensas e indicações
  • Suporte prioritário
Iniciar teste grátis

*Não é necessário cartão de crédito

Melhor custo-benefício
12 meses
179.87
Just €0.49/daySave 40%
Tudo incluído:
  • Pesquisa ilimitada de respostas
  • Testes práticos ilimitados
  • Explicações com AI
  • Biblioteca completa de recursos
  • Mais de 20 idiomas
  • Atualizações semanais de conteúdo
  • Recompensas e indicações
  • Suporte prioritário
Iniciar teste grátis

*Não é necessário cartão de crédito

✓ Plano gratuito incluído · ✓ Cancele a qualquer momento · ✓ Todos os planos desbloqueiam o produto completo