Amazon MLS-C01: Analyse exploratoire des données et visualisation — Guide d'étude
Fait partie du AWS Machine Learning Specialty MLS-C01 — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Amazon, ou passez des tests chronométrés sur ExamRoll.io.
Distributions, transformations et mise à l’échelle des caractéristiques
La compréhension des distributions des caractéristiques brutes est le fondement de l’EDA. Commencez par profiler chaque variable avec des histogrammes, des estimations de densité par noyau et des résumés de quantiles dans un notebook SageMaker Studio ou une tâche SageMaker Processing (ml.m5.xlarge avec scikit-learn/pandas). Les transformations logarithmiques, Box-Cox, Yeo-Johnson et celles basées sur le rang (transformateur de quantiles) sont appropriées pour les données asymétriques à droite, mais Box-Cox exige des valeurs strictement positives et échoue sur les zéros. Les pièges courants incluent l’application de log/Box-Cox sans compenser les zéros et l’oubli d’inverser les transformations lors de l’interprétation des sorties du modèle. La standardisation (moyenne nulle, variance unitaire) est essentielle avant les méthodes basées sur la distance (k-means, PCA, SVM) et avant les modèles linéaires régularisés ; la mise à l’échelle Min-Max est utile pour les réseaux de neurones avec des activations bornées. Lors du déploiement, persistez les transformateurs dans SageMaker Feature Store ou en tant qu’artefacts de modèle afin que l’inférence en ligne et par lots utilise un prétraitement identique. Utilisez AWS Glue ou Glue DataBrew pour profiler de très grands jeux de données S3 et générer des statistiques récapitulatives ; utilisez Athena pour interroger des échantillons stratifiés. Les critères de décision dépendent de la sensibilité de l’algorithme : les ensembles d’arbres tolèrent les caractéristiques non mises à l’échelle, tandis que les méthodes linéaires et basées sur la distance ne le font pas. Enfin, recherchez les valeurs aberrantes et les queues lourdes avec des statistiques robustes (médiane, IQR) et examinez s’il faut écrêter (clip), winsoriser ou modéliser séparément (segmentation) plutôt que de supprimer aveuglément des points.
Analyse des résidus, courbes d’apprentissage et tests de diagnostic
Les résidus révèlent une mauvaise spécification du modèle : une moyenne non nulle, l’hétéroscédasticité, l’autocorrélation ou la non-linéarité doivent être diagnostiquées. Tracez les résidus par rapport aux valeurs prédites et par rapport aux caractéristiques clés dans SageMaker Studio ; calculez le Durbin-Watson pour l’autocorrélation et utilisez le Ljung-Box pour la corrélation des résidus de séries temporelles. Pour la régression, recherchez des formes en entonnoir indiquant l’hétéroscédasticité ; appliquez des transformations stabilisatrices de variance ou des modèles hétéroscédastiques (par ex., XGBoost avec un objectif ajusté ou la prévision probabiliste). Les courbes d’apprentissage — graphiques de l’erreur d’entraînement et de validation par rapport à la taille de l’ensemble d’entraînement — identifient une variance élevée (surapprentissage) ou un biais élevé (sous-apprentissage). Utilisez SageMaker Debugger pour capturer les tenseurs par époque et les métriques CloudWatch, et ajoutez une alarme CloudWatch pour se déclencher si la perte de validation diverge alors que la perte d’entraînement diminue. Les pièges courants incluent l’utilisation de la validation croisée aléatoire pour les données temporelles (utilisez des divisions basées sur le temps) et l’évaluation avec l’exactitude (accuracy) sur des ensembles déséquilibrés (préférez la précision-rappel ou l’AUC-PR). Pour l’optimisation des hyperparamètres, prenez des décisions en utilisant ces diagnostics : si l’écart de validation persiste, augmentez la régularisation, ajoutez des données ou réduisez la complexité du modèle ; si les deux erreurs sont élevées, augmentez la capacité ou ajoutez des caractéristiques. Persistez les graphiques de diagnostic et les métriques via SageMaker Experiments pour la reproductibilité.
Réduction de la dimensionnalité, PCA, analyse des valeurs propres et clustering
La réduction de la dimensionnalité réduit le bruit et améliore l’interprétabilité. Appliquez la PCA ou la SVD randomisée (scikit-learn ou Spark MLlib sur EMR/Glue) après la mise à l’échelle ; inspectez le ratio de variance expliquée pour choisir le nombre de composantes et examinez les poids (loadings) pour mapper les composantes aux caractéristiques d’origine. Les signes des vecteurs propres sont arbitraires — interprétez les poids absolus et regroupez les caractéristiques par magnitude. Pour une structure fortement non linéaire, utilisez t-SNE ou UMAP pour la visualisation uniquement, et non comme prétraitement pour les modèles sans une validation croisée minutieuse. Pour le clustering, choisissez k-means pour les clusters sphériques (mise à l’échelle requise), les modèles de mélange gaussien (Gaussian Mixture Models) pour les affectations souples, et DBSCAN pour les formes basées sur la densité ; exécutez les scores de silhouette et l’indice de Davies-Bouldin pour comparer. Sur de grands jeux de données, utilisez l’algorithme k-means intégré de SageMaker (instances GPU/CPU) ou exécutez le mini-batch k-means dans SageMaker Processing. Méfiez-vous du piège consistant à appliquer la PCA à des caractéristiques catégorielles encodées en one-hot — envisagez le hachage de caractéristiques (feature hashing) ou des couches d’intégration (embedding layers). Utilisez les graphiques du coude (elbow plots), les graphiques de variance expliquée et la stabilité des clusters sur des sous-échantillons pour décider de k. Persistez les centroïdes de cluster et les transformateurs PCA dans SageMaker Feature Store afin que l’évaluation en temps réel en aval et les modèles basés sur des segments utilisent des transformations cohérentes.
Visualisation, surveillance et intégration AWS pour la dérive et la performance
La visualisation est à la fois exploratoire et opérationnelle : utilisez matplotlib/seaborn dans SageMaker Studio pour des graphiques ad-hoc et Amazon QuickSight pour des tableaux de bord qui suivent les métriques de performance en direct. Pour la dérive du modèle et la qualité des données, établissez des lignes de base (baselines) avec un échantillon d’entraînement représentatif via SageMaker Model Monitor et SageMaker Clarify afin de détecter les changements de distribution, les modifications de l’importance des caractéristiques et les biais. Configurez Model Monitor avec une ligne de base dérivée d’un artefact de tâche de traitement (Processing job) et activez la surveillance continue sur les points de terminaison (endpoints) déployés avec des vérifications horaires/quotidiennes ; les événements CloudWatch et SNS peuvent déclencher des alertes. Pour l’ingestion et l’analyse en streaming, utilisez Kinesis Data Firehose pour persister les données JSON dans S3 avec une conversion de format vers Parquet (activez la conversion de format d’enregistrement et l’intégration du Glue Catalog) ou attachez une fonction Lambda pour des transformations personnalisées. Pour des requêtes SQL en quasi-temps réel sur des fichiers compressés, partitionnez et enregistrez les données dans le Glue Data Catalog et interrogez-les avec Athena, en rafraîchissant les partitions via une fonction Lambda à l’arrivée de nouveaux objets S3. Les pièges courants incluent l’oubli de versionner les lignes de base, l’ignorance de l’évolution du schéma (utilisez Glue Schema Registry) et le fait de se fier uniquement aux métriques agrégées — incluez toujours la dérive par caractéristique et la performance par segment pour détecter une dégradation localisée. Utilisez SageMaker Experiments et Model Monitor ensemble pour corréler les changements d’hyperparamètres avec les événements de dérive et maintenir la traçabilité (lineage).
Problème pratique : Scénario d’utilisation
Scénario : Le détaillant Acme utilise la pile ML d’AWS avec SageMaker Studio, un data lake S3, l’ingestion via Kinesis Firehose, le Glue Data Catalog et QuickSight pour la visualisation. L’équipe stocke les données démographiques des clients, les journaux de session et les achats dans S3 aux formats JSON et Parquet.
Défi : Identifier les segments de clients les plus susceptibles de se désabonner (churn) dans les six prochains mois et mettre en place une surveillance pour détecter si les distributions des caractéristiques ou la performance du modèle dérivent après le déploiement.
Approche recommandée :
- Créer une tâche de traitement SageMaker (Processing job) (ml.m5.xlarge) pour échantillonner et profiler les données avec pandas/sklearn, appliquer des transformations log/Box–Cox si nécessaire, et enregistrer les artefacts de prétraitement dans SageMaker Feature Store.
- Calculer une ACP (PCA) (scikit-learn ou Spark ML sur Glue/EMR) après mise à l’échelle pour réduire la dimensionnalité, examiner la variance expliquée et les contributions (loadings), et effectuer un clustering avec SageMaker xgboost ou l’algorithme k-means intégré pour dériver des segments.
- Entraîner un modèle de classification (XGBoost dans SageMaker ou un petit réseau de neurones (NN) avec TensorFlow) en utilisant des divisions entraînement/validation temporelles, consigner les métriques dans SageMaker Experiments, et configurer l’arrêt anticipé (early stopping) et la pondération des classes pour le déséquilibre.
- Déployer avec un SageMaker Endpoint, activer Model Monitor en utilisant une ligne de base générée par la tâche de traitement, configurer des vérifications de dérive horaires et des alarmes CloudWatch pour notifier via SNS ; visualiser la performance et la dérive au niveau des segments dans QuickSight.
Justification : Cette approche combine un prétraitement robuste, une réduction de dimensionnalité interprétable et un clustering scalable pour la segmentation, tandis que SageMaker Model Monitor et QuickSight fournissent une détection opérationnelle de la dérive des données et des performances, assurant un prétraitement reproductible grâce à Feature Store et des expériences suivies pour l’analyse des causes profondes.
← Ingénierie des données et ingénierie des caractéristiques · Tous les domaines · Modélisation — Supervisée et non supervisée (ML classique) →
Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Réussissez votre examen →