Google PDE: Data Governance, Beveiliging, Betrouwbaarheid en Kostenbeheer — Studiegids

Onderdeel van de Google Professional Data Engineer — Studiegids. Oefen met geverifieerde antwoorden in het Google-examencentrum, of doe getimede oefentests op ExamRoll.io.

Overzicht

Dit gedeelte vat ontwerppatronen en operationele praktijken samen voor data governance, beveiliging, betrouwbaarheid en kostenbeheer op Google Cloud. Het richt zich op BigQuery, Cloud Storage, Dataflow, Dataplex en ondersteunende services. De nadruk ligt op ’least privilege’, beheer van encryptiesleutels, metadata en classificatie, beleidsgestuurde toegang, bewijs van compliance, observeerbaarheid met bruikbare SLO’s en kostenbeheersing. Afwegingen, faalscenario’s en praktische configuraties worden behandeld om veilige, auditeerbare en efficiënte dataplatforms mogelijk te maken.

Identiteit, Toegang en Governance

Security- en Compliance-operaties

Betrouwbaarheid, Observeerbaarheid, Kwaliteit en Kostenbeheer

undefined

- Reserveer slots met BigQuery Reservations voor voorspelbare workloads; scheid interactieve van batch-workloads via toewijzingen (assignments)

Praktijkscenario

NovaRetail Analytics werkt samen met meerdere merken om dagelijks CSV’s met transactiedata op te nemen in een gedeeld analyseplatform. Bestanden komen binnen in een Cloud Storage landing bucket en bevatten af en toe onjuist geformatteerde rijen. Het platform moet het ’least privilege’-principe afdwingen, zodat elke klant alleen toegang heeft tot zijn eigen data, gevoelige velden detecteren en onmiddellijk waarschuwen wanneer rijen worden toegevoegd aan een specifieke audittabel. Het bedrijf heeft ook kostenbeheersing en een herstelplan nodig.

Aanpak:

  1. Isoleer tenants en dwing ’least privilege’ af

    • Maak een aparte BigQuery-dataset per klant (bijv. client_a_analytics). Geef alleen de groep van de klant de juiste dataset-rollen (bigquery.dataViewer, bigquery.jobUser) en beperk het gebruik van de BigQuery API tot goedgekeurde gebruikers via IAM en eventueel VPC-SC.
    • Rationale: Een dataset per tenant beperkt de ‘blast radius’ en vereenvoudigt de complexiteit van rij-beleid. Scoping op datasetniveau met ’least privilege’ voorkomt standaard toegang tussen tenants.
  2. Beheer schema, classificatie en maskering

    • Definieer een Data Catalog policy tag-taxonomie (public, internal, confidential, restricted) en tag templates voor eigenaar, data steward en RTO/RPO. Koppel policy tags aan gevoelige kolommen (email, card_suffix) in elke klantendataset. Pas BigQuery-maskeringsbeleid toe om de weergave voor niet-geprivilegieerde rollen te beperken.
    • Voorbeeld:

undefined

.

  1. Ontdek PII en dwing de-identificatie af waar nodig

    • Configureer Sensitive Data Protection discovery om de landing bucket en de gecureerde BigQuery-tabellen te scannen. Gebruik een inspectietemplate voor veelvoorkomende PII en een de-identificatietemplate om e-mails deterministisch te tokenizen voor join-use-cases.
    • Rationale: Geautomatiseerde ontdekking vermindert handmatige fouten; deterministische tokenisatie brengt privacy in evenwicht met de join-vereisten voor analyses.
  2. Beveilig de pipeline met service accounts, impersonation en CMEK

    • Gebruik een Dataflow service account met alleen de benodigde rollen: storage.objectViewer op de landing bucket, bigquery.dataEditor op de doel-datasets, en indien nodig toegang tot policy tags. Gebruik CMEK voor de klantendatasets en geef de BigQuery en Dataflow service agents de CryptoKey Encrypter/Decrypter-rol.
    • Rationale: Beperkte rollen plus CMEK voldoen aan de vereisten voor ’least privilege’ en sleutelbeheer. Toegang van de service agent tot sleutels voorkomt dat jobs mislukken.
  3. Bouw een veerkrachtige opname (ingest) met foutenquarantaine

    • Voer een batch Dataflow-job uit die de CSV’s leest, het schema valideert en geldige rijen naar gepartitioneerde BigQuery-tabellen schrijft. Leid ongeldige rijen om naar een BigQuery dead-letter-tabel met foutdetails (bestandsnaam, regel, reden).
    • Rationale: Side outputs bewaren foute data voor analyse zonder de goede data te blokkeren; gepartitioneerde tabellen verlagen de scankosten en versnellen query’s.
  4. Creëer lineage en business metadata

    • Registreer de landing bucket en datasets als Dataplex-assets in een lake. Schakel lineage-verzameling in voor de Dataflow-job en tag gecureerde tabellen met business metadata (data-eigenaar, gevoeligheid, retentie).
    • Rationale: Gecentraliseerde governance maakt impactanalyse, audit-gereedheid en gestandaardiseerd stewardship mogelijk.
  5. Monitor, alarmeer en audit

    • Schakel Admin en Data Access audit logs in, geëxporteerd met CMEK naar een centraal logging-project en naar BigQuery voor analyses. Voeg een op logs gebaseerde alert toe voor nieuwe rijen die aan de audittabel worden toegevoegd met behulp van een geavanceerd filter op BigQuery insert-jobs; exporteer die sink naar Pub/Sub zodat de monitoringtool deze kan consumeren.
    • Rationale: Logs zijn fraudebestendig bewijs; gerichte alerts geven alleen een melding voor de vereiste tabel, wat ruis vermindert.
  6. Dwing kostenbeheersing en query-guardrails af

    • Vereis dat query-jobs maximumBytesBilled instellen en maak gebruik van clustering op kolommen met hoge cardinaliteit (bijv. order_id). Pas budgetten toe en stel labels in (client, environment) op jobs en datasets. Gebruik BigQuery Reservations om interactieve analyses te scheiden van geplande laadprocessen.
    • Rationale: Guardrails voorkomen uit de hand lopende kosten; labels maken doorberekening (chargeback) mogelijk; slot-isolatie zorgt voor voorspelbare prestaties.
  7. Implementeer retentie en DR

    • Schakel in de landing bucket object-versiebeheer en een lifecycle-regel in om objecten na 30 dagen te verwijderen; stel een retentiebeleid in voor compliance-zones. Stel in BigQuery een standaard tabelverloopdatum in voor staging-tabellen en maak periodiek tabel-snapshots van gecureerde tabellen. Bewaar KMS-back-upprocedures en stappen voor het herstellen van tabellen in runbooks en test deze per kwartaal.
    • Rationale: Lifecycle management verlaagt de opslagkosten; snapshots en gedocumenteerde runbooks garanderen herstelbaarheid. Testen valideert de RTO/RPO-aannames.
  8. Periodieke toegangsreviews en kwaliteits-SLI’s/SLO’s

Behandelde technische afwegingen en faalscenario’s:


Machine Learning · Alle domeinen

Oefen deze vragen → · Getimede oefening op ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Slaag voor je examen →

Blader door Google →

Related guides

Alles-in-één toegang

Eén abonnement. Elk examen.

Elk plan ontgrendelt onbeperkt zoeken naar antwoorden, oefentests, AI-uitleg en de volledige bronnenbibliotheek — in meer dan 20 talen.

Maandelijks
24.87
Just €0.83/day
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

Beste waarde
12 maanden
179.87
Just €0.49/daySave 40%
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

✓ Gratis plan inbegrepen · ✓ Annuleer op elk moment · ✓ Alle plannen ontgrendelen het volledige product