Amazon MLS-C01: MLOps, Monitoring, Labelen & Model Governance — Studiegids

Onderdeel van de AWS Machine Learning Specialty MLS-C01 — Studiegids. Oefen met geverifieerde antwoorden in het Amazon-examencentrum, of doe getimede oefentests op ExamRoll.io.

Pijplijnen, CI/CD en Automatisering

Productieklare ML vereist end-to-end automatisering die data-ingestie, validatie, training, tuning, model packaging en deployment samenvoegt in herhaalbare pipelines. Gebruik Amazon SageMaker Pipelines om stappen te definiëren voor Processing jobs (Data Wrangler of ScriptProcessor), Training (beheerde training met Distributed Data Parallel of XGBoost/BlazingText), Hyperparameter Tuning (HyperparameterTuningJob met objectieve metriek en StoppingCondition voor de training job), en het registreren van modellen in de SageMaker Model Registry. Integreer Pipelines met AWS CodePipeline en CodeBuild voor CI-checks en unit tests op codeniveau, en gebruik CloudFormation of CDK om consistente omgevingen te provisioneren. Configureer caching op stappen om te voorkomen dat ongewijzigd werk opnieuw wordt uitgevoerd, en parametriseer pipeline-invoer (S3-prefixes, instance types). Vertrouw voor HPO niet alleen op MaxNumberOfTrainingJobs; stel ook een StoppingCondition per training job in (MaxRuntimeInSeconds) en schakel geautomatiseerde early stopping in waar beschikbaar om oplopende kosten te vermijden. Veelvoorkomende valkuilen zijn het gebruik van File mode voor steeds groter wordende datasets (stap over op Pipe mode of gedistribueerde training voor grote datasets), het niet toepassen van versiebeheer op datasets en features, en het nalaten om datavalidatiepoorten (SageMaker Processing + Deequ of Data Wrangler-checks) op te nemen vóór het hertrainen. Beslissingscriteria tussen in-database modellen (Redshift ML) en SageMaker zijn gebaseerd op modelcomplexiteit, latency en operationele controle: Redshift ML is handig voor eenvoudige XGBoost-modellen binnen SQL, terwijl SageMaker vereist is voor deep nets, custom architecturen en schaalbare endpoints.

Monitoring, Drift Detectie en Modelkwaliteit

Continue monitoring moet zowel de prestaties van het model als de datakwaliteit vastleggen. Schakel data capture in op SageMaker model-endpoints om requests en responses op te slaan in S3, en maak vervolgens een baseline van de trainingsdistributie met een SageMaker Model Monitor baseline job. Gebruik de ingebouwde Model Monitor-checks voor schemabreinbreuken en univariate drift-metrieken; bereken voor distributieverschuivingen KL divergence, Population Stability Index (PSI) of KS-tests en stel CloudWatch-alarmen in op drift-drempelwaarden. Houd modelmetrieken bij—classificatie: precision/recall, ROC AUC, verwarringsmatrix en klasspecifieke FPR/FNR; regressie: RMSE, MAE en MAPE. Clarify kan controles op bias en uitlegbaarheid uitvoeren vóór en na de training en SHAP-gebaseerde feature-attributies produceren; gebruik Clarify om prestatieverschillen tussen subgroepen (gevoelige attributen) te detecteren. Veelvoorkomende operationele valkuilen zijn het niet vastleggen van de inferentiecontext (feature mapping, modelversie, request ID), het negeren van label-latentie (vertraagde labels verstoren een tijdige evaluatie), en het verwarren van populatieverschuiving met concept drift—behandel deze verschillend (hertrainen versus labels verzamelen en features opnieuw evalueren). Voor alarmering, push geaggregeerde metrieken en drift-indicatoren naar CloudWatch, en automatiseer een rollback of hertraining via SageMaker Pipelines wanneer drempelwaarden worden overschreden.

Labeling, Datavoorbereiding en Feature Engineering

Kwalitatieve labels en consistente feature-pipelines zijn fundamenteel. Gebruik Amazon SageMaker Ground Truth om labeling-workflows te creëren met geautomatiseerde pre-labeling (modelondersteunde labeling), active learning en annotatieconsolidatie; kies workertypes (private workforce, vendor of public) en configureer labelverificatie en metrieken voor inter-annotator overeenstemming. Voor EDA en transformatie, ingest datasets in SageMaker Data Wrangler om distributies te profileren, ontbrekende waarden te imputeren en verwerkingsscripts te exporteren naar SageMaker Processing jobs. Persisteer online en offline features in Amazon SageMaker Feature Store voor consistente runtime-ophaling en eenvoudige backfills. Encoderingsbeslissingen hangen af van schaal en kardinaliteit: categorische variabelen met lage kardinaliteit kunnen one-hot gecodeerd worden; items met hoge kardinaliteit (bijv. 100 product-SKU’s) gebruiken target encoding of embeddings (TensorFlow/PyTorch embedding layers of ingebouwde SageMaker-algoritmes), en meerkeuze-antwoorden in enquêtes worden gemapt naar multi-hot vectoren. Pas op voor veelvoorkomende valkuilen zoals label leakage bij het toevoegen van dagelijkse metadata (neem feature engineering-vensters en leakage-tests op), het gebruik van File mode voor zeer grote S3-datasets (Pipe mode streamt records en ondersteunt gedistribueerde training over meerdere instances), en het niet toepassen van versiebeheer op transformaties—exporteer Data Wrangler-transformaties naar herbruikbare Processing/Training-stappen om pariteit tussen training en inferentie te garanderen.

Verklaarbaarheid, Governance en het Schalen van ML-Teams

Verklaarbaarheid en governance vereisen bruikbare artefacten en audittrails. Gebruik SageMaker Clarify om pre-training bias-metrieken en post-training feature-attributies (SHAP) te berekenen en de resultaten op te slaan bij Model Registry-vermeldingen. Registreer modellen in de SageMaker Model Registry met goedkeuringsstatussen, ondertekende ModelPackageGroups en geautomatiseerde ‘promotion gates’. Volg experimenten en ’lineage’ met SageMaker Experiments en schakel CloudTrail in voor het auditen van API-aanroepen. Voor verklaarbaarheidstechnieken, geef de voorkeur aan modelspecifieke ‘feature importance’ voor boommodellen (ingebouwde SHAP van XGBoost), en gebruik SHAP of ‘integrated gradients’ voor deep networks, rekening houdend met de runtime-kosten — bereken verklaringen vooraf offline voor batch-klanten en stel samenvattingen beschikbaar voor real-time verzoeken. Best practices voor governance omvatten ‘model cards’ met datasetbeschrijvingen, fairness-controles en gedocumenteerde bedrijfsregels, en het afdwingen van het ’least privilege’-principe van IAM voor modelimplementatie. Om teams te schalen, modulariseer pipelines, creëer standaard templates voor preprocessing/validatie, centraliseer de Feature Store en automatiseer ‘drift detection’ en hertraining-triggers, zodat data scientists zich kunnen richten op verbeteringen in plaats van op operationele taken. Veelvoorkomende valkuilen zijn te veel vertrouwen op ‘feature importance’ voor causaliteit, het niet bijhouden van auditlogs voor geïmplementeerde modellen, en het synchroon aanbieden van kostbare verklaarbaarheidsberekeningen in endpoints met lage latentie.

Praktijkprobleem: Use-Case Scenario

Scenario: Acme Manufacturing beheert vloten van sensoren op afstand met onderbroken connectiviteit en gebruikt AWS IoT en S3 voor centrale aggregatie. Hun AWS ML-omgeving omvat SageMaker, IoT Core, Kinesis Data Streams en edge-apparaten met Greengrass.

Uitdaging: Lever anomaliedetectie met lage latentie op externe locaties wanneer de connectiviteit onderbroken is, terwijl telemetrie wordt verzameld voor gecentraliseerde hertraining en ‘drift detection’ zonder Direct Connect.

Aanbevolen Aanpak:

  1. Implementeer een compact anomaliedetectiemodel, gecompileerd met SageMaker Neo, op AWS IoT Greengrass op edge-apparaten voor real-time lokale inferentie en acties (lokale alarmen, korte-termijn buffering).
  2. Stream samengevatte telemetrie en anomalie-vlaggen via AWS IoT Core naar Amazon Kinesis Data Streams, en gebruik Kinesis Data Firehose om ruwe en geaggregeerde data persistent op te slaan in S3 (parquet) voor centrale opslag.
  3. Bouw een SageMaker Pipeline die S3-batches verwerkt, Processing-jobs (Data Wrangler) uitvoert om baselines en feature engineering te berekenen, indien nodig HyperparameterTuningJobs activeert, en gevalideerde modellen registreert in de SageMaker Model Registry.
  4. Schakel SageMaker Model Monitor in op het centrale endpoint en plan batch-jobs die de op de edge verzamelde distributies vergelijken met de trainingsbaselines (PSI/KL), en gebruik SageMaker Ground Truth met gesamplede waarschuwingen voor menselijke labeling om de cirkel te sluiten.

Rationale: Edge-inferentie via Greengrass + Neo zorgt voor beslissingen met lage latentie bij onderbroken connectiviteit; Kinesis + Firehose garandeert betrouwbare, geordende opname in S3 voor hertraining; SageMaker Pipelines en Model Registry bieden herhaalbare hertraining, versiebeheer en geautomatiseerde ‘promotion’ met drift-controles om de modelkwaliteit te handhaven.


Beveiliging · Alle domeinen

Oefen deze vragen → · Getimede oefening op ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Slaag voor je examen →

Blader door Amazon →

Related guides

Alles-in-één toegang

Eén abonnement. Elk examen.

Elk plan ontgrendelt onbeperkt zoeken naar antwoorden, oefentests, AI-uitleg en de volledige bronnenbibliotheek — in meer dan 20 talen.

Maandelijks
24.87
Just €0.83/day
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

Beste waarde
12 maanden
179.87
Just €0.49/daySave 40%
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

✓ Gratis plan inbegrepen · ✓ Annuleer op elk moment · ✓ Alle plannen ontgrendelen het volledige product