Google PDE: Dataopslag, Lakes en Bestandsformaten — Studiegids

Onderdeel van de Google Professional Data Engineer — Studiegids. Oefen met geverifieerde antwoorden in het Google-examencentrum, of doe getimede oefentests op ExamRoll.io.

Overzicht

Dataopslag op Google Cloud omvat ruwe object storage, gecureerde data lakes en voor analytics geoptimaliseerde formaten. Het bouwen van betrouwbare, beheerde en performante lakes vereist zorgvuldige keuzes in opslagklassen, bucket-instellingen, locaties, bestandsformaten, tabelindeling en levenscyclus. Dit gedeelte beschrijft de afwegingen in het ontwerp, te vermijden faalscenario’s en patronen die aansluiten bij BigQuery, Spark en streaming-pipelines op grote schaal.

Grondbeginselen van Cloud Storage: klassen, buckets, consistentie en levenscyclus

Cloud Storage is de duurzame, hoog beschikbare basis voor ruwe en gecureerde bestanden.

undefined

Verenigde lake governance met BigLake en Dataplex

BigLake en Dataplex standaardiseren beveiliging en governance voor bestanden en tabellen.

Bestandsformaten, compressie en querygedrag

De keuze van het juiste formaat heeft een directe impact op de kosten en prestaties.

Indeling, partitionering, performance-engineering, residentie en migratie

undefined

Praktijkscenario

Acme Retail ontvangt dagelijks CSV-drops van een logistieke partner in een regionale Cloud Storage-bucket. De bestanden bevatten af en toe ongeldige rijen. Acme moet de data landen, valideren, converteren naar een analyse-klaar formaat en laden in BigQuery voor near-real-time dashboards, terwijl ongeldige rijen bewaard blijven voor inspectie en governance wordt afgedwongen.

Aanpak:

  1. Ruwe data landen en beheren in Dataplex

    • Maak een Dataplex-lake met een raw zone-asset die is gekoppeld aan gs://acme-raw/logistics/.
    • Rationale: Gecentraliseerde governance, metadata en lineage. Dwing IAM af op zoneniveau en tag gevoelige velden met policy-tags voor downstream-handhaving.
  2. Lifecycle en retentie afdwingen

    • Pas een bucket-retentiebeleid van 30 dagen toe en schakel object-versiebeheer in op acme-raw.
    • Rationale: Beschermt tegen onbedoeld overschrijven/verwijderen door de partner; een korte retentieperiode balanceert kosten en herstelbaarheid. Versiebeheer maakt een rollback van slechte leveringen mogelijk.
  3. Valideren en opnemen met een Dataflow-batchpipeline

    • Trigger een dagelijkse Dataflow-taak op basis van ‘object finalize’-meldingen. Lees CSV met schema en validatie per record; schrijf geldige records naar een BigQuery-stagingtabel (gepartitioneerd op event_date) en stuur parseer-/validatiefouten naar een dead-letter BigQuery-tabel.
    • Rationale: Dataflow biedt schaalbare parallelle parsing en robuuste dead-letter-afhandeling, zodat analisten ongeldige rijen kunnen inspecteren. Dit weerspiegelt de best practice voor heterogene CSV-kwaliteit.
  4. Compacteer en converteer naar Parquet in een curated zone

    • Dezelfde pipeline schrijft gevalideerde data naar gs://acme-curated/logistics/date=YYYY-MM-DD/ als Parquet-bestanden van ~256–512 MB.
    • Rationale: Parquet maakt column pruning en predicate pushdown mogelijk in BigQuery en Spark, waardoor het aantal gescande bytes afneemt en de latentie verbetert; compactie beperkt de overhead van kleine bestanden die voortkomt uit het leveringspatroon van de partner.
  5. Beheerde analyses beschikbaar stellen via BigLake

    • Maak een externe BigLake-tabel over het curated Parquet-pad met Hive auto-partitionering; pas policy-tags op kolomniveau en rij-toegangsbeleid toe voor partnerspecifieke filters.
    • Rationale: Uniforme, fijnmazige toegang over BigQuery en Spark met gecentraliseerde audit. Partition pruning verlaagt de scankosten bij datumfilters.
  6. Laad kritieke aggregaten in native BigQuery

    • Voer voor ‘hot’ dashboards een geplande BigQuery-taak uit die de laatste N dagen opneemt uit de externe curated Parquet-tabel in een native geclusterde, gepartitioneerde tabel.
    • Rationale: Native opslag versnelt BI met hoge concurrency, terwijl de externe BigLake-tabel het beheerde ‘system-of-record’ blijft voor bredere toegang.
  7. Monitoren en alarmeren met Cloud Logging en Pub/Sub

    • Maak een log-sink die de resultaten van Dataflow- en BigQuery-laadtaken filtert naar Pub/Sub; integreer met de monitoringtool voor directe waarschuwingen bij storingen of verhoogde percentages ongeldige rijen.
    • Rationale: Gerichte, tabelspecifieke operationele zichtbaarheid zonder polling; ondersteunt SRE-praktijken.
  8. Optimaliseer opslagklasse en residentie

    • Bewaar de curated Parquet-data 14 dagen in Standard, zet na 30 dagen over naar Coldline via een lifecycle-regel; sla zowel de raw als de curated buckets op in dezelfde regio als de BigQuery-datasets om egress te vermijden.
    • Rationale: Balanceert ‘hot read’-prestaties met kosten. Co-locatie handhaaft compliance en minimaliseert latentie en egress-kosten.
  9. Valideer end-to-end kwaliteit

    • Vergelijk na elke run de aantallen en hash-aggregaten tussen de staging-, curated externe en native BigQuery-tabellen; plaats afwijkingen in quarantaine.
    • Rationale: Vroege detectie van schema-drift of regressies in de opname; cryptografische of fingerprint-hashes bieden lichtgewicht zekerheid zonder volledige re-scans.

Dit ontwerp biedt een veerkrachtige opname met dead-letter-analyse, analyse-klaar Parquet voor efficiënte query’s, gecentraliseerde governance via Dataplex en BigLake, en kosten-geoptimaliseerd lifecycle-beleid, terwijl het principe van ’least-privilege access’ en auditeerbare operaties wordt gevolgd.


Data Engineering Architectuur en Ontwerp · Alle domeinen · BigQuery Analytics en Warehouse Engineering

Oefen deze vragen → · Getimede oefening op ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Slaag voor je examen →

Blader door Google →

Related guides

Alles-in-één toegang

Eén abonnement. Elk examen.

Elk plan ontgrendelt onbeperkt zoeken naar antwoorden, oefentests, AI-uitleg en de volledige bronnenbibliotheek — in meer dan 20 talen.

Maandelijks
24.87
Just €0.83/day
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

Beste waarde
12 maanden
179.87
Just €0.49/daySave 40%
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

✓ Gratis plan inbegrepen · ✓ Annuleer op elk moment · ✓ Alle plannen ontgrendelen het volledige product