Google PDE: Machine Learning, AI en Data Serving — Studiegids
Onderdeel van de Google Professional Data Engineer — Studiegids. Oefen met geverifieerde antwoorden in het Google-examencentrum, of doe getimede oefentests op ExamRoll.io.
Overzicht
Het bouwen van productiewaardige machine learning- en data-serving-systemen op Google Cloud vereist gedisciplineerde datamodellering, robuuste pipelines en operationele waarborgen. Dit gedeelte behandelt modelontwikkeling in BigQuery ML, de beheerde levenscyclus op Vertex AI (datasets, training, pipelines, endpoints, feature engineering en monitoring), het ontwerp van predictiepaden (batch versus online), feature stores en point-in-time correctheid, labeling en bias-controles, vector search en retrieval-augmented generation-patronen, lineage en governance, drift-monitoring en hertrainingstriggers, analytics-serving-lagen en privacybewust datagebruik. De nadruk ligt op ontwerpbeslissingen, schaalstrategieën en veelvoorkomende faalscenario’s die vermeden moeten worden.
BigQuery ML en Feature Engineering
BigQuery ML maakt het mogelijk om direct in SQL te trainen, evalueren en voorspellen, waardoor dataverplaatsing wordt geëlimineerd en de modelontwikkeling wordt afgestemd op analytische datasets.
Modelcreatie: gebruik CREATE MODEL met expliciete labelkolommen en feature-transformaties om lekkage te voorkomen en inputs te standaardiseren. Voorbeeld: CREATE OR REPLACE MODEL ds.churn_model OPTIONS( model_type=‘logistic_reg’, input_label_cols=[‘churned’], l1_reg=0.0, l2_reg=1.0, data_split_method=‘AUTO’ ) TRANSFORM( standardize(tenure_months) AS tenure_std, quantile_bucketize(monthly_spend, 10) AS spend_bkt, one_hot_encoder(region) AS region_ohe, ml.feature_cross(struct(bucketize(lat, 60), bucketize(lon, 60))) AS latlon_cross, (xx + yy) AS r2 – voeg ondersteuning voor circulaire beslissingsgrenzen toe wanneer nuttig ) AS SELECT churned, tenure_months, monthly_spend, region, lat, lon, x, y FROM ds.customer_features;
Evaluatie: gebruik ML.EVALUATE om metrieken te verkrijgen die passen bij het modeltype (bijv. ROC AUC voor classificatie, RMSE voor regressie). Houd baselines en betrouwbaarheidsintervallen bij; houd evaluatiedatasets in chronologische volgorde om toekomstige prestaties te benaderen. SELECT * FROM ML.EVALUATE(MODEL ds.churn_model, TABLE ds.eval_features);
Predictie: gebruik ML.PREDICT voor online-achtige scoring in BigQuery, of exporteer modellen voor serving elders. Houd rekening met de latency-budgetten van het model bij het gebruik van BigQuery voor synchrone scoring; voor API’s met een hoge QPS, implementeer naar beheerde endpoints. SELECT user_id, predicted_churn FROM ML.PREDICT(MODEL ds.churn_model, TABLE ds.scoring_candidates);
Feature-transformaties: geef de voorkeur aan declaratieve TRANSFORM-functies (standardize, one_hot_encoder, bucketize, quantile_bucketize, ml.feature_cross) voor reproduceerbaarheid en om de preprocessing aan het modelartefact te koppelen. Houd transformaties idempotent en deterministisch.
Operationele overwegingen en faalscenario’s:
- Streaming inserts en query-actualiteit: BigQuery streaming heeft eventual consistency. Voor real-time aggregaties die zojuist geschreven rijen moeten bevatten, voer queries uit met een vertraging die de gemeten latency van de streamingbuffer overschrijdt. Een conservatief uitgangspunt is om ongeveer 2× de waargenomen gemiddelde beschikbaarheidsvertraging te wachten, of ontwerp watermarks en verwerking van late data in Dataflow voordat deze in BigQuery terechtkomen.
- Kosten en concurrency: als de on-demand slot concurrency-limieten een bottleneck worden, schakel dan over naar flat-rate of flexibele reserveringen en implementeer workload management (reserveringshiërarchieën en -toewijzingen) om voorspelbare capaciteit te garanderen.
- Datakwaliteit: voor GCS batch-ladingen met onjuist geformatteerde rijen, gebruik Dataflow om records te parsen en te valideren, waarbij de correcte rijen naar BigQuery worden geschreven en de incorrecte rijen naar een dead-letter table voor inspectie. Voorkom dat BigQuery volledige bestanden afwijst vanwege een klein aantal incorrecte rijen.
Levenscyclus van Vertex AI, prediction paths en feature stores
Vertex AI biedt end-to-end beheerde services voor training, pipelines, model registry, endpoints en monitoring.
Datasets en training: registreer datasets en metadata; gebruik waar nodig custom training jobs of AutoML. Kies algoritmen op basis van beperkingen:
- Workloads op een enkele VM met beperkte resources geven de voorkeur aan eenvoudige modellen (bijv. lineaire regressie of logistieke regressie) vanwege de lage geheugen-/CPU-vereisten.
- Taken met een hoge dimensionaliteit profiteren vaak van featureselectie of het combineren van redundante features om de training te versnellen met minimaal verlies van nauwkeurigheid.
- Unsupervised anomaly detection is geschikt wanneer positieve voorbeelden zeldzaam zijn en wordt verwacht dat toekomstige afwijkingen lijken op bekende afwijkende signaturen.
Pipelines: implementeer Vertex AI Pipelines om datapreparatie, training, evaluatie en deployment gates te codificeren. Sla parameters, code commit SHA’s, container digests en dataset snapshots op om reproduceerbaarheid te garanderen.
Endpoints en prediction:
- Online prediction voor workloads met lage latentie. Configureer minimale en maximale replica’s en autoscaling-beleid; profileer de latentie van het model op P95 en stel SLO’s dienovereenkomstig in. Voeg canary deployments en traffic splitting toe voor veilige rollouts.
- Batch prediction voor jobs waarbij doorvoer prioriteit heeft (bijv. nachtelijke scoring). Batch vermijdt per-request overhead en is goedkoper voor grote volumes, maar biedt een hogere latentie.
Feature engineering en feature stores: gebruik Vertex AI Feature Store voor:
- Offline store in BigQuery voor training.
- Online store voor lookups met lage latentie op basis van entity ID. Handhaaf consistentie tussen training en serving door dezelfde transformatielogica te delen (bijv. Dataflow-bibliotheek of feature-definities) en door feature-timestamps te gebruiken om datalekken (leakage) te voorkomen. Behoud point-in-time correctheid met temporele joins:
undefined
Ontwerpafwegingen:
- Latentie van online store versus actualiteit: online stores die door Bigtable worden ondersteund, bieden een lage latentie; zorg ervoor dat backfills en streaming upserts idempotent zijn. Overmatige write skew of hot keys verminderen de prestaties—ontwerp entity ID’s om het verkeer gelijkmatig te verdelen.
- Batch versus online: batch vermindert de complexiteit en kosten van serving, maar kan verouderde voorspellingen opleveren. Voor dynamisch gedrag (bijv. aanbevelingen), combineer periodieke hertraining met actuele features op het moment van serving.
Datakwaliteit, labeling, bias, privacy en governance
Labels van hoge kwaliteit en een rigoureuze governance vormen de basis voor betrouwbare modellen.
Labeling en onbalans:
- Gebruik duidelijke richtlijnen voor labeling en QA-steekproeven. Volg de inter-annotator agreement.
- Pak onbalans in klassen aan met gestratificeerde sampling, herweging of resampling; monitor precisie/recall per klasse, niet alleen de algehele nauwkeurigheid.
- Behoud null-waarden opzettelijk. Als een model numerieke invoer vereist, codeer null-waarden dan expliciet (bijv. 0 met een ‘was_null’-indicator) en valideer de downstream impact; vermijd het stilzwijgend verwijderen van informatieve ontbrekende waarden.
Overfitting en generalisatie:
- Mitigaties omvatten meer diverse trainingsdata, kleinere feature sets en sterkere regularisatie.
- Early stopping en cross-validatie zijn essentieel voor neurale netwerken; subsampling kan de trainingstijd verkorten wanneer schalen van architectuur of hardware niet haalbaar is.
Governance en lineage:
- Volg de lineage met Vertex ML Metadata, Model Registry en Data Catalog. Registreer datasetversies, transformaties, hyperparameters en de omgeving.
- Goedkeuringsworkflows: vereis menselijke goedkeuring vóór de deployment, met behulp van statussen in Model Registry en Cloud Build/Deploy met beleidscontroles. Sla artefacten op in Artifact Registry; onderteken containers en dwing Binary Authorization af voor gecontroleerde rollouts (gated rollouts).
Monitoring, drift en hertraining:
- Activeer modelmonitoring voor prediction skew, feature drift en prestatievermindering. Gebruik distributionele metrieken (bijv. PSI, KL-divergentie) en ground-truth evaluatie die rekening houdt met vertraging (lag-aware) waar labels later binnenkomen.
- Stel triggers voor hertraining in op basis van statistisch significante drift, schendingen van SLO’s of zakelijke event-vensters. Automatiseer hertrainingspipelines, maar controleer de promotie met evaluaties en bias-controles.
- Pas op voor stille data drift door upstream schemawijzigingen; dwing schemacontracten af en waarschuw bij ontbrekende of verschoven features.
Privacybewust ontwerp:
- Classificeer data met behulp van Data Catalog policy tags; dwing beveiliging op kolom- en rijniveau af in BigQuery, met beleid voor datamaskering.
- Minimaliseer dataverzameling; implementeer SLA’s voor dataretentie en -verwijdering die gekoppeld zijn aan doelbinding.
- Pas DLP toe voor discovery en de-identificatie; versleutel data met CMEK; isoleer services met VPC Service Controls; zorg voor fijnmazige IAM en gebruik toegewijde service accounts met het ’least privilege’-principe.
- Redigeer PII bij monitoring en logging en vermijd het loggen van payloads waar dit niet noodzakelijk is.
Vector search, RAG-pijplijnen en analytics serving-lagen
Moderne retrieval en serving vereisen zowel vector-native componenten als beproefde analytics-opslag.
Vector search en embeddings:
- Gebruik Vertex AI Vector Search of BigQuery vector search voor grootschalige, low-latency nearest neighbor retrieval; kies AlloyDB for PostgreSQL met pgvector voor app-centrische semantiek en transactionele behoeften.
- Genereer embeddings in batch met Vertex Pipelines; sla vectoren op naast dense metadata; partitioneer en indexeer intelligent (bijv. op documentdomein) om de latency te beperken.
Retrieval-augmented generation-pijplijnen:
- Voer content in via Dataflow of Dataproc, extraheer tekst, chunk, embed en indexeer in een vector store. Behoud source-of-truth-referenties voor traceerbaarheid.
- Implementeer freshness-strategieën: periodiek opnieuw embedden, invalidatie bij bronupdates en canary-indexering om de kwaliteit te valideren voordat indexen worden gewisseld.
- Monitor de retrieval-kwaliteit (hit rate, MRR, nDCG) en contentveiligheid; handhaaf guardrails en toegangscontroles voor beperkte data.
Analytics serving-lagen en datagedreven producten:
- Cureer bronze/silver/gold-dataproducten in BigQuery; gebruik partitionering en clustering om scankosten te minimaliseren. Materialized views kunnen veelvoorkomende query’s versnellen.
- Gebruik voor low-latency key-value of high-QPS counters Bigtable met goed gedistribueerde row keys; vermijd hot-spotting door prefixes te salten of te hashen.
- Gebruik voor OLTP-workloads en sterke consistentie Cloud SQL of Spanner; offload analytics naar BigQuery via geplande ELT.
- Streaming-ontwerp: Pub/Sub → Dataflow → BigQuery/Bigtable met autoscaling. Monitor backlog- en watermark-metrics; standaard autoscaling volstaat voor elastische workloads en houdt tegelijkertijd de kosten onder controle.
Operationele tip:
- Om meldingen te activeren voor specifieke BigQuery table insert-taken, exporteer je relevante Cloud Logging-vermeldingen naar Pub/Sub met een geavanceerd filter en koppel je vervolgens waarschuwingen vanaf de subscription:
undefined
Praktijkscenario
AcmeStyle, een modemarktplaats, wil de aanbevelingen op hun site actueel houden omdat de voorkeuren van gebruikers per uur veranderen. Ze streamen klik- en aankoopgedrag en moeten dit combineren met cataloguscontext om aanbevelingen met lage latency en beheerste kosten te vernieuwen.
Aanpak:
- Stream-invoer en kwaliteitscontroles
- Gebruik Pub/Sub voor de invoer van events van web en mobiel. Een Dataflow streaming-taak valideert schema’s, verrijkt deze met catalogusdata en schrijft:
- Schone events naar gepartitioneerde tabellen in BigQuery (event_date) voor offline analytics en training.
- Geaggregeerde user-feature-updates naar Vertex AI Feature Store (online store) met user_id als sleutel. Rationale: Pub/Sub ontkoppelt producers en consumers; Dataflow biedt exactly-once semantiek met idempotente upserts; gepartitioneerde BigQuery beheert kosten en retentie; de online store maakt lookups van milliseconden mogelijk.
- Feature-definities met point-in-time correctheid
- Definieer features zoals rolling CTR, merkvoorkeur en recentheid met een expliciete event_time. Materialiseer naar:
- Offline store in BigQuery voor training met temporele joins beperkt tot feature_ts <= label_ts.
- Online store voor serving met TTL’s om verouderde waarden te voorkomen. Rationale: Duidelijke timestamps voorkomen label leakage; consistente definities voor offline/online zorgen voor pariteit tussen training en serving.
- Model-training en lineage
- Implementeer een Vertex AI Pipeline die:
- Trainingsdata uit BigQuery haalt met behulp van tijdvensters (bijv. de laatste 30 dagen).
- Dezelfde transformaties toepast die in serving worden gebruikt (gedeelde library).
- Een rankingmodel traint; metadata (dataset snapshot-ID’s, code commit SHA, hyperparameters) logt naar ML Metadata en het model registreert in de Model Registry. Rationale: Pipelines maken runs reproduceerbaar en auditeerbaar; Model Registry centraliseert versies en goedkeuringen.
- Batch- en online-voorspellingspaden
- Nachtelijke batch-voorspellingen die de volledige catalogus-gebruikersmatrix scoren in BigQuery voor backfill en A/B-testen.
- Online-voorspellingen via een Vertex-endpoint dat:
- Recente gebruikersfeatures ophaalt uit de online store.
- Top-K-kandidaten scoort, gefilterd op voorraad en beschikbaarheid.
- Resultaten voor korte periodes cacht om pieken op te vangen. Rationale: Batch biedt breedte en kostenefficiëntie; online vangt het meest recente gedrag op voor sessies met hoge waarde. Autoscaling-endpoints handhaven latency-SLO’s; caching vermindert tail latency en kosten.
- Monitoring, drift-detectie en hertrainingsbeleid
- Schakel model-monitoring in voor feature drift en prediction skew; vergelijk distributies met de trainingsbaselines. Volg CTR/CVR SLO’s en waarschuw bij verslechtering.
- Hertrain continu met een rolling window dat historische en nieuwe data combineert; activeer hertraining wanneer drift de drempels overschrijdt of minimaal wekelijks. Rationale: Modetrends veranderen snel; het combineren van historie met recente signalen stabiliseert het leerproces terwijl het model actueel blijft.
- Privacy en governance
- Tag PII-kolommen met Data Catalog policy-tags; handhaaf kolom-level security in BigQuery en maskeer waar nodig. Voer DLP-scans uit op ruwe events; sla alleen noodzakelijke velden op.
- Vereis menselijke goedkeuring om modellen van staging naar productie te promoveren via Cloud Build-triggers die zijn geïntegreerd met de goedkeuringsstatussen van Model Registry. Rationale: Toegang volgens het ’least privilege’-principe vermindert risico’s; het bewaken van deployments waarborgt compliance en veiligheid.
- Kosten- en capaciteitsbeheer
- Gebruik BigQuery-reserveringen om voorspelbare slot-capaciteit te garanderen voor trainingsvensters.
- Schaal Dataflow-workers automatisch op basis van de backlog; shard hot keys in de feature store door user_id-prefixes te hashen om hot-spotting te voorkomen. Rationale: Voorspelbare capaciteit voorkomt conflicten; autoscaling stemt de uitgaven af op de vraag; gebalanceerde keys zorgen voor low-latency updates.
Dit ontwerp houdt aanbevelingen actueel door streaming-features voor serving te verenigen met regelmatige hertraining op recente data, terwijl correctheid, governance en voorspelbare prestaties op schaal worden gehandhaafd.
← Workflow-orkestratie en Pipeline-automatisering · Alle domeinen · Data Governance →
Oefen deze vragen → · Getimede oefening op ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Slaag voor je examen →