Amazon MLS-C01: Modélisation — Supervisée et non supervisée (ML classique) — Guide d'étude
Fait partie du AWS Machine Learning Specialty MLS-C01 — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Amazon, ou passez des tests chronométrés sur ExamRoll.io.
Choix du modèle et architecture pour les problèmes supervisés
La sélection d’un modèle commence par la forme des données et les contraintes de production. Pour un signal linéaire avec de nombreux exemples et des coefficients interprétables, la régression linéaire ou logistique régularisée (SageMaker LinearLearner ou ElasticNet de scikit-learn) est rapide et produit des coefficients que vous pouvez inspecter. Lorsque les interactions non linéaires dominent, les ensembles d’arbres tels que XGBoost (conteneur SageMaker XGBoost) ou LightGBM capturent l’hétérogénéité sans nécessiter une mise à l’échelle intensive des caractéristiques ; ajustez eta (learning_rate), max_depth, subsample, colsample_bytree, et la régularisation alpha/lambda pour contrôler le surajustement. Les SVM peuvent être efficaces sur des ensembles de caractéristiques de petite à moyenne taille et bien mis à l’échelle, mais nécessitent généralement des conteneurs personnalisés ou le ScriptMode de scikit-learn sur SageMaker car les grands jeux de données sont coûteux ; n’oubliez pas de standardiser les caractéristiques et de choisir soigneusement le noyau/la régularisation (C, gamma). Naive Bayes est une base de référence rapide pour les entrées catégorielles/textuelles éparses et de haute dimension ; il suppose l’indépendance conditionnelle et échoue lorsque les corrélations sont fortes. Pour des milliers de caractéristiques ou de très grands jeux de données, utilisez la réduction de dimensionnalité (PCA) ou le hachage de caractéristiques (feature hashing) et préférez l’entraînement distribué sur des instances ml.c5 ou ml.p3 si vous utilisez des réseaux de neurones profonds basés sur GPU. Déployez avec les points de terminaison (endpoints) SageMaker pour l’inférence en temps réel ou avec Batch Transform pour les prédictions en masse ; utilisez les Multi-Model Endpoints lorsque vous maintenez de nombreux modèles pour réduire les coûts.
Métriques, déséquilibre, calibration et compromis de déploiement
L’exactitude (accuracy) est séduisante mais trompeuse pour les problèmes déséquilibrés ; préférez des métriques sensibles aux classes telles que la précision, le rappel (recall), le F1, l’AUC ROC pour mettre l’accent sur l’équilibre des classes, et l’AUC PR lorsque la classe positive est rare. Lorsque vous produisez des probabilités, vérifiez la calibration avec des diagrammes de fiabilité et le score de Brier ; utilisez la mise à l’échelle de Platt (Platt scaling) ou la calibration isotonique implémentée hors ligne (CalibratedClassifierCV de scikit-learn) ou calibrez au sein de l’entraînement SageMaker en sortant les scores bruts et en appliquant une étape de post-traitement. Pour gérer le déséquilibre des classes, préférez la pondération des échantillons (prise en charge dans SageMaker LinearLearner et de nombreux scripts d’entraînement), le suréchantillonnage ciblé (SMOTE) ou le sous-échantillonnage pendant l’entraînement, et la re-pondération de la perte (loss re-weighting) ou la perte focale (focal loss) pour les réseaux de neurones. Pour l’évaluation en temps quasi réel des probabilités de fraude, optimisez la latence du modèle en utilisant un type d’instance à faible latence d’inférence (ml.m5.large ou des instances optimisées pour le CPU), gardez les modèles compacts (élaguez ou utilisez des modèles distillés), et utilisez des points de terminaison multi-modèles (multi-model endpoints) ou la répartition du trafic A/B via les points de terminaison SageMaker pour déployer les mises à jour en toute sécurité. Surveillez la dérive en production et la qualité des données avec SageMaker Model Monitor et automatisez l’enregistrement des métriques dans CloudWatch.
Ingénierie des caractéristiques, multicolinéarité et régularisation
La multicolinéarité augmente la variance des estimations des coefficients dans les modèles linéaires ; détectez-la avec le facteur d’inflation de la variance (VIF) et la corrélation de Pearson par paires, et atténuez-la en supprimant les caractéristiques redondantes ou en utilisant la réduction de dimensionnalité (PCA, SVD). La régularisation est un remède de principe : L2 (Ridge) réduit les coefficients, L1 (Lasso) induit la parcimonie pour la sélection de caractéristiques, et ElasticNet combine les deux — ces méthodes sont disponibles dans scikit-learn et SageMaker LinearLearner. Pour les caractéristiques numériques fortement asymétriques, appliquez des transformations logarithmiques ou Box-Cox pour stabiliser la variance et améliorer l’ajustement des modèles linéaires ; rappelez-vous que les ensembles d’arbres sont robustes aux transformations monotones tandis que les SVM et les réseaux de neurones nécessitent des entrées standardisées (StandardScaler) pour un entraînement stable. Les caractéristiques catégorielles à haute cardinalité bénéficient de l’encodage par la cible (target encoding), des plongements (embeddings) ou du hachage (hashing) ; lorsque l’encodage par la cible est utilisé, évitez la fuite de données (leakage) en calculant les encodages au sein des plis de validation croisée ou en utilisant un ensemble de données de validation distinct (holdout). Utilisez SageMaker Feature Store pour centraliser et servir des transformations de caractéristiques cohérentes à la fois pour l’entraînement et l’inférence, et persistez le code de prétraitement avec les paquets de modèles (model packages) ou les images Docker afin que les transformations en production correspondent à celles de l’entraînement.
Méthodes non supervisées, clustering, détection d’anomalies et interprétabilité
Le clustering et la détection d’anomalies sont des outils exploratoires et des étapes de prétraitement pour la modélisation supervisée. K-means (SageMaker k-means) est rapide mais suppose des clusters sphériques et nécessite des caractéristiques mises à l’échelle ; choisissez k avec prudence à l’aide des scores de silhouette ou des graphiques du coude, car l’inertie peut être ambiguë. Les méthodes basées sur la densité (DBSCAN) et le clustering hiérarchique capturent une structure non sphérique mais sont plus coûteuses en termes de calcul. Pour la détection d’anomalies à grande échelle, envisagez SageMaker Random Cut Forest pour les données de capteurs en streaming et les pipelines Kinesis/Lambda pour la notation en quasi-temps réel ; ajustez le nombre d’arbres et la taille de l’échantillon pour contrôler la sensibilité. Les outils d’interprétabilité sont essentiels : utilisez l’importance des caractéristiques native du modèle pour les modèles à base d’arbres et les valeurs SHAP (package SageMaker Clarify ou SHAP) pour les explications locales et les résumés des effets globaux. Méfiez-vous des pièges courants : la fuite temporelle lors de la division aléatoire de données ordonnées dans le temps, la dépendance excessive à la précision dans des contextes déséquilibrés, et l’hypothèse d’indépendance pour Naive Bayes. Pour le déploiement, empaquetez les algorithmes personnalisés dans Docker si nécessaire, exposez des points de terminaison (endpoints) de prédiction et de santé, et orchestrez des déploiements canary via la répartition du trafic sur les points de terminaison.
Problème Pratique : FleetSight Logistics — ML exploratoire sur les images de camions
Scénario : FleetSight collecte environ 100 Go/jour d’images de camions stockées dans S3 et utilise SageMaker Studio pour les expérimentations et SageMaker Ground Truth pour l’étiquetage des images. Ils ont besoin de capacités de ML légères pour la détection de défauts avec l’intention de passer à l’échelle ultérieurement.
Défi : Identifier des cas d’usage supervisés/non supervisés réalisables et un pipeline à faible coût pour entraîner les modèles initiaux avec des étiquettes limitées et une inférence en quasi-temps réel pour les alertes.
Approche Recommandée :
- Utiliser SageMaker Ground Truth avec l’apprentissage actif pour étiqueter un jeu de données initial ; stocker les données étiquetées dans S3 et enregistrer les caractéristiques dans SageMaker Feature Store.
- Commencer par la détection d’anomalies non supervisée en utilisant SageMaker Random Cut Forest sur les métadonnées de capteurs dérivées des images et des plongements (embeddings) d’images simples (extraire les embeddings avec un CNN pré-entraîné dans un notebook SageMaker en utilisant un GPU ml.p3.2xlarge).
- Entraîner un classifieur supervisé léger en utilisant l’apprentissage par transfert (conteneur TensorFlow ou PyTorch intégré à SageMaker) sur le sous-ensemble étiqueté ; pour des lignes de base rapides, extraire les embeddings et entraîner un modèle XGBoost (SageMaker XGBoost) sur des instances CPU.
- Déployer le modèle XGBoost sur un point de terminaison (endpoint) SageMaker avec inférence asynchrone ou un Multi-Model Endpoint pour la rentabilité ; surveiller les entrées et les prédictions avec SageMaker Model Monitor et itérer sur l’étiquetage via Ground Truth.
Justification : Utiliser les embeddings non supervisés + Random Cut Forest pour trouver des anomalies candidates sans avoir besoin de nombreuses étiquettes, puis amorcer des modèles supervisés via l’apprentissage par transfert et XGBoost pour une inférence compacte et rapide ; les services SageMaker fournissent un flux de travail de développement et de surveillance intégré et évolutif.
← Analyse exploratoire des données et visualisation · Tous les domaines · Apprentissage profond et vision par ordinateur →
Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Réussissez votre examen →