Google PDE: Governança de Dados, Segurança, Confiabilidade e Operações de Custo — Guia de estudos
Faz parte do Google Professional Data Engineer — Guia de estudos. Pratique com respostas verificadas no centro de exames da Google, ou faça testes cronometrados no ExamRoll.io.
Visão Geral
Esta seção resume os padrões de design e as práticas operacionais para governança de dados, segurança, confiabilidade e operações de custo no Google Cloud. Ela se concentra no BigQuery, Cloud Storage, Dataflow, Dataplex e serviços de suporte. A ênfase está no princípio do menor privilégio, gerenciamento de chaves de criptografia, metadados e classificação, acesso orientado por políticas, evidências de conformidade, observabilidade com SLOs acionáveis e controle de custos. Trade-offs, modos de falha e configurações práticas são incluídos para permitir plataformas de dados seguras, auditáveis e eficientes.
Identidade, Acesso e Governança
IAM, contas de serviço, personificação, identidade de carga de trabalho, menor privilégio
- Limites de identidade
- Usuários e grupos via Cloud Identity ou Google Workspace
- Contas de serviço para cargas de trabalho; atribua funções com escopo restrito no recurso prático mais baixo (por exemplo, conjunto de dados em vez de projeto)
- Menor privilégio
- Prefira funções predefinidas em vez de funções primitivas; para o BigQuery, use funções como bigquery.dataViewer em conjuntos de dados em vez da função de visualizador no nível do projeto
- Conceda permissões a grupos; gerencie a associação em um IdP, não no IAM por usuário
- Separação de funções: papéis separados para gerenciamento de chaves, acesso a dados e administração
- Personificação e Workload Identity Federation
- Use a personificação de conta de serviço (Service Account Impersonation) (roles/iam.serviceAccountTokenCreator) para que o CI/CD ou a automação nunca armazenem chaves de longa duração
- Use o Workload Identity Federation com OIDC/SAML para permitir que identidades externas obtenham tokens de curta duração sem arquivos de chave de conta de serviço
- Modos de falha e mitigações
- Funções excessivas no nível do projeto levam ao movimento lateral; audite com o Cloud Asset Inventory
- Chaves privadas de contas de serviço perdidas: não permita a criação de chaves; use restrições de política da organização para bloquear o download de chaves; rotacione se encontradas
- Limites de identidade
Governança do Dataplex, Data Catalog, metadados de negócios, linhagem
- O Dataplex fornece lagos (lakes), zonas (zones) e ativos (assets) para unificar a governança sobre o BigQuery e o Cloud Storage com políticas centralizadas
- O Data Catalog contém um glossário de negócios, modelos de tag e metadados técnicos; anexe metadados de negócios (proprietário, classe de PII, RTO/RPO) por meio de tags
- A linhagem captura os relacionamentos de upstream e downstream; use as integrações de linhagem do Dataplex com o Dataflow, Dataproc e BigQuery para rastrear o impacto e o escopo de conformidade
- Trade-offs
- A governança centralizada adiciona uma sobrecarga inicial, mas reduz o risco a longo prazo e acelera as auditorias
Tags de política, classificação, acesso em nível de linha, mascaramento de coluna
- Classificação
- Defina uma taxonomia (por exemplo, pública, interna, confidencial, restrita) nas tags de política do Data Catalog
- Anexe tags de política a colunas do BigQuery; vincule o IAM às tags para que o acesso siga a classificação entre as tabelas
- Mascaramento de coluna
- Use as políticas de mascaramento de dados do BigQuery para aplicar hash ou anular colunas sensíveis para leitores não privilegiados
- Exemplo:
- ALTER TABLE fin.payments ALTER COLUMN card_number SET POLICY TAGS (‘pii.restricted’);
- Acesso em nível de linha
- Use políticas de acesso a linhas para filtrar registros por atributos como tenant_id ou região
- Exemplo:
- CREATE ROW ACCESS POLICY tenant_filter ON sales.orders GRANT TO (“group:analysts@acme.com”) FILTER USING (tenant_id = “acme”);
- Modos de falha
- A não concessão de permissões IAM para tags de política a contas de serviço usadas por pipelines causa falhas nas consultas; inclua a permissão de visualizador/acessador de tags de política para os agentes de serviço, conforme necessário
- Políticas de linha podem degradar o desempenho se houver muitos predicados por usuário altamente seletivos; prefira uma abordagem de granularidade mais grossa, com um conjunto de dados por locatário (tenant), onde o isolamento é rigoroso
- Classificação
Descoberta e desidentificação de dados sensíveis
- Use o Sensitive Data Protection para escanear continuamente o Cloud Storage e o BigQuery; crie configurações de descoberta por lago (lake)/zona (zone) com modelos
- Use transformações de desidentificação: tokenização, criptografia determinística para permitir junções (joinability) ou mascaramento
- Armazene as chaves de transformação no Cloud KMS; mantenha as chaves de reidentificação separadas com controle duplo
- Trade-offs
- A criptografia determinística permite junções (joins), mas pode vazar informações de frequência; adicione criptografia com preservação de formato ou bucketing conforme necessário
- A amostragem reduz o custo das varreduras de descoberta, mas pode não detectar PII de baixa prevalência
Operações de Segurança e Conformidade
Criptografia, Cloud KMS, CMEK e gerenciamento de secrets
- A criptografia em repouso e em trânsito é padrão; habilite o CMEK onde o controle regulatório das chaves é exigido (BigQuery, GCS, Pub/Sub, Dataflow)
- Gerenciamento de chaves
- Posicione as chaves na mesma região dos dados; conceda ao agente de serviço (ex.: BigQuery Service Agent) as funções/papéis
roles/cloudkms.cryptoKeyEncrypterDecrypter - Rotacione as chaves regularmente; monitore chaves desativadas ou agendadas para destruição
- Posicione as chaves na mesma região dos dados; conceda ao agente de serviço (ex.: BigQuery Service Agent) as funções/papéis
- Modos de falha
- Desativar uma chave CMEK ou revogar o agente de serviço interrompe cargas, consultas e exportações; alerte sobre mudanças no estado da chave
- O uso de chaves entre regiões não é permitido; alinhe as localizações para evitar erros na criação de jobs
- Secrets
- Use o Secret Manager para credenciais de banco de dados, tokens de API; conceda acesso via IAM e audite com os logs do Secret Manager
- Nunca incorpore secrets em código, contêineres ou notebooks; monte os secrets via acesso em tempo de execução; prefira a autenticação de banco de dados do IAM onde for compatível
Logs de auditoria, revisão de acesso, evidências de conformidade e retenção
- Habilite os logs de Acesso a Dados (Data Access logs) em toda a organização para BigQuery, GCS, Pub/Sub; exporte para um projeto de logging dedicado, somente de escrita, com CMEK
- Crie coletores de logs (sinks) agregados para o BigQuery (análises) e para o Cloud Storage (arquivamento imutável de longo prazo com bloqueio de retenção de bucket)
- Use o Cloud Asset Inventory e o Policy Analyzer para revisão periódica de acesso e detecção de desvios (drift)
- Retenção
- Defina a retenção de logs de acordo com as necessidades de conformidade; use o versionamento de objetos e políticas de retenção no GCS
- No BigQuery, defina a expiração padrão da tabela e utilize snapshots de tabela/time travel para reversão de curto prazo; arquive conjuntos de dados críticos em projetos separados
- Evidências
- Mantenha um mapeamento de controle com tags do Dataplex (ex.: “SOX-C2: Evidência no projeto X, sink Y”), automatize as exportações e execute consultas agendadas para produzir atestados
← Machine Learning · Todos os domínios
Pratique estas questões → · Prática cronometrada no ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Passe no seu exame →