Google PDE: Governance, Sicurezza, Affidabilità e Operazioni sui Costi dei Dati — Guida allo studio

Fa parte della Google Professional Data Engineer — Guida allo studio. Esercitati con risposte verificate nel centro esami Google, oppure fai test cronometrati su ExamRoll.io.

Panoramica

Questa sezione riassume i design pattern e le pratiche operative per la data governance, la sicurezza, l’affidabilità e le operazioni di costo su Google Cloud. Si concentra su BigQuery, Cloud Storage, Dataflow, Dataplex e i servizi di supporto. L’enfasi è posta sul principio del privilegio minimo (least privilege), sulla gestione delle chiavi di crittografia, sui metadati e la classificazione, sull’accesso basato su policy, sulle prove di conformità, sull’osservabilità con SLO attuabili e sul controllo dei costi. Vengono inclusi i compromessi (trade-off), le modalità di guasto (failure modes) e le configurazioni pratiche per abilitare piattaforme dati sicure, verificabili ed efficienti.

Identità, Accesso e Governance

undefined

undefined

undefined

undefined

Operazioni di Sicurezza e Conformità

Affidabilità, Osservabilità, Qualità e Gestione dei Costi

undefined

- Prenotare slot con BigQuery Reservations per carichi di lavoro prevedibili; separare i carichi interattivi da quelli batch tramite assegnazioni (assignment)

Scenario Pratico

NovaRetail Analytics collabora con diversi brand per l’ingestion giornaliera di file CSV contenenti dati transazionali in una piattaforma di analisi condivisa. I file arrivano in un bucket di landing su Cloud Storage e occasionalmente includono righe malformate. La piattaforma deve applicare il principio del privilegio minimo (least privilege) in modo che ogni cliente possa accedere solo ai propri dati, rilevare campi sensibili e fornire alert immediati quando vengono aggiunte righe a una specifica tabella di audit. L’azienda necessita anche di controlli sui costi e di un piano di ripristino.

Approccio:

  1. Isolare i tenant e applicare il principio del privilegio minimo

    • Creare un dataset BigQuery dedicato per ogni cliente (es. client_a_analytics). Concedere solo al gruppo del cliente i ruoli appropriati sul dataset (bigquery.dataViewer, bigquery.jobUser) e limitare l’uso dell’API di BigQuery agli utenti approvati tramite IAM e, se applicabile, VPC-SC.
    • Motivazione: Un dataset per tenant limita il “blast radius” (raggio d’impatto) e semplifica la complessità delle policy a livello di riga. L’applicazione del privilegio minimo a livello di dataset impedisce di default l’accesso incrociato tra tenant.
  2. Governare schema, classificazione e mascheramento

    • Definire una tassonomia di policy tag in Data Catalog (public, internal, confidential, restricted) e modelli di tag (template) per proprietario, data steward e RTO/RPO. Associare i policy tag alle colonne sensibili (email, card_suffix) in ogni dataset del cliente. Applicare le policy di mascheramento di BigQuery per limitare la visualizzazione per i ruoli non privilegiati.
    • Esempio:

undefined

  1. Individuare PII e applicare la de-identificazione dove necessario

    • Configurare la discovery di Sensitive Data Protection per scansionare il bucket di landing e le tabelle BigQuery curate. Utilizzare un modello di ispezione (inspection template) per le PII comuni e un modello de-identificazione (de-identification template) per tokenizzare le email in modo deterministico per i casi d’uso che richiedono join.
    • Motivazione: La discovery automatizzata riduce gli errori manuali; la tokenizzazione deterministica bilancia la privacy con i requisiti di join per l’analisi.
  2. Mettere in sicurezza la pipeline con service account, impersonation e CMEK

    • Utilizzare un service account di Dataflow con solo i ruoli necessari: storage.objectViewer sul bucket di landing, bigquery.dataEditor sui dataset di destinazione e accesso ai policy tag se richiesto. Utilizzare CMEK per i dataset dei clienti e concedere agli agenti di servizio (service agent) di BigQuery e Dataflow il ruolo CryptoKey Encrypter/Decrypter.
    • Motivazione: Ruoli con permessi ristretti più CMEK soddisfano i requisiti di privilegio minimo e di controllo delle chiavi. L’accesso alle chiavi da parte dei service agent previene i fallimenti dei job.
  3. Costruire un’ingestion resiliente con quarantena degli errori

    • Eseguire un job batch di Dataflow che legge i CSV, valida lo schema e scrive le righe valide in tabelle partizionate di BigQuery. Instradare le righe non valide a una tabella dead-letter di BigQuery con i dettagli dell’errore (nome file, riga, motivo).
    • Motivazione: Gli output secondari (side output) conservano i dati errati per l’analisi senza bloccare i dati validi; le tabelle partizionate riducono i costi di scansione e velocizzano le query.
  4. Creare lineage e metadati di business

    • Registrare il bucket di landing e i dataset come asset Dataplex in un lake. Abilitare la raccolta del lineage per il job di Dataflow e aggiungere tag alle tabelle curate con metadati di business (proprietario dei dati, sensibilità, conservazione).
    • Motivazione: Una governance centralizzata abilita l’analisi di impatto, la preparazione agli audit e una stewardship standardizzata.
  5. Monitorare, generare alert e fare audit

    • Abilitare gli audit log di tipo Admin e Data Access, esportati con CMEK verso un progetto di logging centralizzato e su BigQuery per l’analisi. Aggiungere un alert basato sui log per le nuove righe aggiunte alla tabella di audit utilizzando un filtro avanzato sui job di inserimento di BigQuery; esportare tale sink su Pub/Sub affinché lo strumento di monitoraggio possa consumarlo.
    • Motivazione: I log sono prove a prova di manomissione; gli alert mirati notificano solo sulla tabella richiesta, riducendo il rumore.
  6. Applicare controlli sui costi e “guardrail” per le query

    • Richiedere che i job di query impostino maximumBytesBilled e sfruttare il clustering su colonne ad alta cardinalità (es. order_id). Applicare budget e impostare etichette (label) (cliente, ambiente) su job e dataset. Utilizzare BigQuery Reservations per separare l’analisi interattiva dai caricamenti pianificati.
    • Motivazione: I “guardrail” prev

Machine Learning · Tutti i domini

Esercitati su queste domande → · Pratica cronometrata su ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Supera l'esame →

Sfoglia Google →

Related guides

Accesso tutto incluso

Un abbonamento. Ogni esame.

Ogni piano sblocca la ricerca illimitata di risposte, test pratici, spiegazioni AI e la libreria completa di risorse — in oltre 20 lingue.

Mensile
24.87
Just €0.83/day
Tutto incluso:
  • Ricerca risposte illimitata
  • Test pratici illimitati
  • Spiegazioni basate su AI
  • Libreria completa di risorse
  • Oltre 20 lingue
  • Aggiornamenti settimanali dei contenuti
  • Premi e referral
  • Supporto prioritario
Inizia la prova gratuita

Nessuna carta di credito richiesta*

Miglior valore
12 mesi
179.87
Just €0.49/daySave 40%
Tutto incluso:
  • Ricerca risposte illimitata
  • Test pratici illimitati
  • Spiegazioni basate su AI
  • Libreria completa di risorse
  • Oltre 20 lingue
  • Aggiornamenti settimanali dei contenuti
  • Premi e referral
  • Supporto prioritario
Inizia la prova gratuita

Nessuna carta di credito richiesta*

✓ Piano gratuito incluso · ✓ Annulla in qualsiasi momento · ✓ Tutti i piani sbloccano il prodotto completo