Amazon MLS-C01: Modelleren — Gesuperviseerd & niet-gesuperviseerd (Classical ML) — Studiegids
Onderdeel van de AWS Machine Learning Specialty MLS-C01 — Studiegids. Oefen met geverifieerde antwoorden in het Amazon-examencentrum, of doe getimede oefentests op ExamRoll.io.
Modelkeuze & architectuur voor gesuperviseerde problemen
Het selecteren van een model begint met de vorm van de data en de productievereisten. Voor een lineair signaal met veel voorbeelden en interpreteerbare coëfficiënten is geregulariseerde lineaire of logistische regressie (SageMaker LinearLearner of scikit-learn ElasticNet) snel en levert het coëfficiënten op die je kunt inspecteren. Wanneer niet-lineaire interacties domineren, vangen tree ensembles zoals XGBoost (SageMaker XGBoost container) of LightGBM heterogeniteit op zonder zware feature scaling; tune eta (learning_rate), max_depth, subsample, colsample_bytree en regularisatie alpha/lambda om overfitting te beheersen. SVM’s kunnen effectief zijn bij kleine tot middelgrote, goed geschaalde feature sets, maar vereisen doorgaans custom containers of scikit-learn ScriptMode op SageMaker omdat grote datasets duur zijn; vergeet niet om features te standaardiseren en de kernel/regularisatie (C, gamma) zorgvuldig te kiezen. Naive Bayes is een snelle baseline voor hoogdimensionale, sparse categorische/tekst-inputs; het gaat uit van conditionele onafhankelijkheid en faalt wanneer correlaties sterk zijn. Gebruik voor duizenden features of zeer grote datasets dimensionaliteitsreductie (PCA) of feature hashing, en geef de voorkeur aan gedistribueerde training op ml.c5- of ml.p3-instances als je GPU-gebaseerde deep nets gebruikt. Deploy met SageMaker endpoints voor real-time inference of Batch Transform voor bulkvoorspellingen; gebruik Multi-Model Endpoints wanneer je veel modellen onderhoudt om kosten te besparen.
Metrics, onbalans, kalibratie en deployment-afwegingen
Accuracy is verleidelijk maar misleidend bij ongebalanceerde problemen; geef de voorkeur aan klasse-gevoelige metrics zoals precision, recall, F1, ROC AUC voor nadruk op gebalanceerde klassen, en PR AUC wanneer de positieve klasse zeldzaam is. Controleer bij het produceren van waarschijnlijkheden de kalibratie met betrouwbaarheidsdiagrammen en Brier score; gebruik Platt scaling of isotonische kalibratie die offline is geïmplementeerd (scikit-learn CalibratedClassifierCV) of kalibreer binnen de SageMaker-training door ruwe scores te outputten en een post-processing stap toe te passen. Om klasse-onbalans aan te pakken, geef je de voorkeur aan sample weighting (ondersteund in SageMaker LinearLearner en veel trainingsscripts), gerichte oversampling (SMOTE) of undersampling tijdens de training, en loss re-weighting of focal loss voor neurale netwerken. Voor het near-real-time scoren van fraudekansen, optimaliseer de latency van het model door een instance type met lage inference latency te gebruiken (ml.m5.large of CPU-geoptimaliseerde instances), houd modellen compact (prune of gebruik gedistilleerde modellen), en gebruik multi-model endpoints of A/B traffic shifting via SageMaker endpoints om updates veilig uit te rollen. Monitor productiedrift en datakwaliteit met SageMaker Model Monitor en automatiseer het loggen van metrics naar CloudWatch.
Feature engineering, multicollineariteit en regularisatie
Multicollineariteit verhoogt de variantie van coëfficiëntschattingen in lineaire modellen; detecteer dit met de variance inflation factor (VIF) en paarsgewijze Pearson-correlatie, en beperk het door redundante features te verwijderen of dimensionaliteitsreductie (PCA, SVD) te gebruiken. Regularisatie is een principiële oplossing: L2 (Ridge) verkleint coëfficiënten, L1 (Lasso) induceert sparsity voor featureselectie, en ElasticNet combineert beide—deze zijn beschikbaar in scikit-learn en SageMaker LinearLearner. Pas voor sterk scheve numerieke features log- of Box-Cox-transformaties toe om de variantie te stabiliseren en de fit van lineaire modellen te verbeteren; onthoud dat tree ensembles robuust zijn tegen monotone transformaties, terwijl SVM’s en neurale netwerken gestandaardiseerde inputs (StandardScaler) nodig hebben voor stabiele training. Categorische features met een hoge kardinaliteit profiteren van target encoding, embeddings of hashing; vermijd bij het gebruik van target encoding datalekken (leakage) door encodings binnen cross-validatie folds te berekenen of een aparte holdout-set te gebruiken. Gebruik SageMaker Feature Store om consistente feature-transformaties te centraliseren en te serveren voor zowel training als inference, en sla preprocessing-code op met model packages of Docker-images zodat productietransformaties overeenkomen met de training.
Unsupervised methoden, clustering, anomaliedetectie en interpreteerbaarheid
Clustering en anomaliedetectie zijn verkennende tools en voorbewerkingsstappen voor supervised modeling. K-means (SageMaker k-means) is snel, maar gaat uit van sferische clusters en vereist geschaalde features; kies k voorzichtig met silhouette scores of elbow plots, omdat inertia dubbelzinnig kan zijn. Op dichtheid gebaseerde methoden (DBSCAN) en hiërarchische clustering kunnen niet-sferische structuren vastleggen, maar zijn rekenkundig duurder. Overweeg voor anomaliedetectie op grote schaal SageMaker Random Cut Forest voor streaming sensordata en Kinesis/Lambda-pipelines voor near-real-time scoring; pas het aantal trees en de sample size aan om de gevoeligheid te regelen. Interpreteerbaarheidstools zijn cruciaal: gebruik model-native feature importance voor tree-modellen en SHAP-waarden (SageMaker Clarify of het SHAP-pakket) voor lokale verklaringen en samenvattingen van globale effecten. Pas op voor veelvoorkomende valkuilen: temporele lekkage bij het willekeurig splitsen van tijdgeordende data, te veel vertrouwen op nauwkeurigheid (accuracy) in ongebalanceerde datasets, en het aannemen van onafhankelijkheid bij Naive Bayes. Voor de implementatie (deployment), verpak aangepaste algoritmen in Docker wanneer dat nodig is, stel prediction- en health-endpoints beschikbaar en orkestreer canary rollouts via traffic-splitting op het endpoint.
Praktijkprobleem: FleetSight Logistics — Verkennende ML op vrachtwagenafbeeldingen
Scenario: FleetSight verzamelt ~100 GB/dag aan vrachtwagenafbeeldingen die zijn opgeslagen in S3 en gebruikt SageMaker Studio voor experimenten en SageMaker Ground Truth voor het labelen van afbeeldingen. Ze hebben lichtgewicht ML-capaciteiten nodig voor defectdetectie, met de intentie om later op te schalen.
Uitdaging: Identificeer haalbare supervised/unsupervised use cases en een goedkope pipeline voor het trainen van initiële modellen met beperkte labels en near-real-time inferentie voor waarschuwingen.
Aanbevolen Aanpak:
- Gebruik SageMaker Ground Truth met active learning om een startset (seed set) te labelen; sla de gelabelde data op in S3 en registreer features in SageMaker Feature Store.
- Begin met unsupervised anomaliedetectie met behulp van SageMaker Random Cut Forest op van afbeeldingen afgeleide sensormetadata en eenvoudige image embeddings (extraheer embeddings met een vooraf getrainde CNN in een SageMaker Notebook met een GPU ml.p3.2xlarge).
- Train een lichtgewicht supervised classifier met behulp van transfer learning (SageMaker built-in TensorFlow- of PyTorch-container) op de gelabelde subset; voor snelle baselines, extraheer embeddings en train een XGBoost-model (SageMaker XGBoost) op CPU-instances.
- Implementeer het XGBoost-model op een SageMaker-endpoint met async inference of een Multi-Model Endpoint voor kostenefficiëntie; monitor de input en voorspellingen met SageMaker Model Monitor en itereer het labelen via Ground Truth.
Rationale: Gebruik unsupervised embedding + Random Cut Forest om kandidaat-anomalieën te vinden zonder veel labels, en bootstrap vervolgens supervised modellen via transfer learning en XGBoost voor compacte, snelle inferentie; SageMaker-services bieden een geïntegreerde, schaalbare ontwikkelings- en monitoringworkflow.
← Verkennende data-analyse · Alle domeinen · Deep Learning →
Oefen deze vragen → · Getimede oefening op ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Slaag voor je examen →