Amazon MLS-C01: MLOps, surveillance, étiquetage et gouvernance des modèles — Guide d'étude

Fait partie du AWS Machine Learning Specialty MLS-C01 — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Amazon, ou passez des tests chronométrés sur ExamRoll.io.

Pipelines, CI/CD et Automatisation

Le ML de niveau production nécessite une automatisation de bout en bout qui relie l’ingestion de données, la validation, l’entraînement, l’optimisation, le packaging du modèle et le déploiement dans des pipelines reproductibles. Utilisez Amazon SageMaker Pipelines pour définir les étapes des tâches de traitement (Processing jobs avec Data Wrangler ou ScriptProcessor), d’entraînement (Training avec entraînement géré via Distributed Data Parallel ou XGBoost/BlazingText), d’optimisation d’hyperparamètres (Hyperparameter Tuning avec HyperparameterTuningJob, une métrique d’objectif et une StoppingCondition pour la tâche d’entraînement), et d’enregistrement des modèles dans le SageMaker Model Registry. Intégrez Pipelines avec AWS CodePipeline et CodeBuild pour les vérifications CI au niveau du code et les tests unitaires, et utilisez CloudFormation ou CDK pour provisionner des environnements cohérents. Configurez la mise en cache sur les étapes pour éviter de ré-exécuter le travail non modifié, et paramétrez les entrées du pipeline (préfixes S3, types d’instance). Pour le HPO, ne vous fiez pas uniquement à MaxNumberOfTrainingJobs ; définissez également une StoppingCondition par tâche d’entraînement (MaxRuntimeInSeconds) et activez l’arrêt anticipé (early stopping) automatisé lorsqu’il est disponible pour éviter des coûts excessifs. Les pièges courants incluent l’utilisation du mode Fichier (File mode) pour des jeux de données en croissance constante (passez au mode Pipe ou à l’entraînement distribué pour les grands jeux de données), le non-versionnement des jeux de données et des caractéristiques (features), et l’omission d’inclure des portes de validation des données (SageMaker Processing + Deequ ou vérifications Data Wrangler) avant le ré-entraînement. Les critères de décision entre les modèles en base de données (Redshift ML) et SageMaker reposent sur la complexité du modèle, la latence et le contrôle opérationnel : Redshift ML est pratique pour les modèles XGBoost simples au sein de SQL, tandis que SageMaker est requis pour les réseaux profonds (deep nets), les architectures personnalisées et les points de terminaison (endpoints) évolutifs.

Surveillance, Détection de Dérive et Qualité du Modèle

La surveillance continue doit capturer à la fois les performances du modèle et la qualité des données. Activez la capture de données (data capture) des points de terminaison (endpoints) de modèle SageMaker pour stocker les requêtes et les réponses sur S3, puis établissez une référence (baseline) de la distribution d’entraînement avec une tâche de référence (baseline job) de SageMaker Model Monitor. Utilisez les vérifications intégrées de Model Monitor pour les violations de schéma et les métriques de dérive univariée ; pour les décalages de distribution, calculez la divergence KL, l’indice de stabilité de la population (PSI), ou les tests KS et définissez des alarmes CloudWatch sur les seuils de dérive. Suivez les métriques du modèle — classification : précision/rappel (precision/recall), AUC ROC, matrice de confusion et FPR/FNR spécifiques à la classe ; régression : RMSE, MAE et MAPE. Clarify peut exécuter des vérifications de biais et d’explicabilité avant et après l’entraînement et produire des attributions de caractéristiques (features) basées sur SHAP ; utilisez Clarify pour détecter les disparités de performance entre sous-groupes (attributs sensibles). Les pièges opérationnels courants incluent le fait de ne pas capturer le contexte d’inférence (mappage des caractéristiques, version du modèle, ID de la requête), d’ignorer la latence des étiquettes (les étiquettes retardées empêchent une évaluation opportune), et de confondre le décalage de population (population shift) avec la dérive de concept (concept drift) — gérez-les différemment (ré-entraîner vs collecter des étiquettes et réévaluer les caractéristiques). Pour les alertes, envoyez les métriques agrégées et les indicateurs de dérive vers CloudWatch, et automatisez le retour en arrière (rollback) ou le ré-entraînement via SageMaker Pipelines lorsque les seuils sont dépassés.

Étiquetage, Préparation des Données et Ingénierie des Caractéristiques

Des étiquettes de qualité et des pipelines de caractéristiques (features) cohérents sont fondamentaux. Utilisez Amazon SageMaker Ground Truth pour créer des flux de travail d’étiquetage avec pré-étiquetage automatisé (étiquetage assisté par modèle), apprentissage actif (active learning) et consolidation des annotations ; choisissez les types de personnel (main-d’œuvre privée, fournisseur ou public) et configurez la vérification des étiquettes et les métriques pour l’accord inter-annotateurs. Pour l’EDA et la transformation, ingérez les jeux de données dans SageMaker Data Wrangler pour profiler les distributions, imputer les valeurs manquantes et exporter des scripts de traitement dans des tâches SageMaker Processing. Persistez les caractéristiques (features) en ligne et hors ligne dans Amazon SageMaker Feature Store pour une récupération cohérente à l’exécution et des remplissages rétrospectifs (backfills) simples. Les décisions d’encodage dépendent de l’échelle et de la cardinalité : les variables catégorielles à faible cardinalité peuvent être encodées en one-hot ; les éléments à haute cardinalité (par ex., 100 références de produits ou SKU) utilisent l’encodage cible (target encoding) ou des plongements (embeddings) (couches d’embedding TensorFlow/PyTorch ou algorithmes intégrés de SageMaker), et les réponses à choix multiples d’un sondage sont mappées sur des vecteurs multi-hot. Méfiez-vous des pièges courants comme la fuite d’étiquettes (label leakage) lors de l’ajout de métadonnées quotidiennes (incluez des fenêtres d’ingénierie des caractéristiques et des tests de fuite), l’utilisation du mode Fichier (File mode) pour de très grands jeux de données S3 (le mode Pipe diffuse les enregistrements en streaming et prend en charge l’entraînement distribué multi-instance), et le non-versionnement des transformations — exportez les transformations de Data Wrangler dans des étapes de traitement (Processing) / entraînement (Training) réutilisables pour garantir la parité entre l’entraînement et l’inférence.

Explicabilité, gouvernance et mise à l’échelle des équipes ML

L’explicabilité et la gouvernance nécessitent des artefacts exploitables et des pistes d’audit. Utilisez SageMaker Clarify pour calculer les métriques de biais avant l’entraînement et les attributions de caractéristiques après l’entraînement (SHAP), et stockez les résultats avec les entrées du Model Registry. Enregistrez les modèles dans SageMaker Model Registry avec des statuts d’approbation, des ModelPackageGroups signés et des portes de promotion automatisées. Suivez les expériences et la traçabilité avec SageMaker Experiments et activez CloudTrail pour l’audit des appels d’API. Pour les techniques d’explicabilité, préférez l’importance des caractéristiques native au modèle pour les modèles arborescents (SHAP intégré à XGBoost), et utilisez SHAP ou les gradients intégrés pour les réseaux profonds tout en étant conscient du coût d’exécution — précalculez les explications hors ligne pour les clients en batch et exposez des résumés pour les requêtes en temps réel. Les meilleures pratiques de gouvernance incluent les fiches de modèle (model cards) avec des descriptions de jeux de données, des vérifications d’équité et des règles métier documentées, ainsi que l’application du moindre privilège IAM pour le déploiement des modèles. Pour faire évoluer les équipes, modularisez les pipelines, créez des modèles standards pour le prétraitement/validation, centralisez le Feature Store, et automatisez la détection de dérive et les déclencheurs de réentraînement afin que les data scientists se concentrent sur les améliorations plutôt que sur les opérations. Les pièges courants incluent une dépendance excessive à l’importance des caractéristiques pour établir la causalité, le non-maintien des journaux d’audit pour les modèles déployés, et l’exposition synchrone de calculs d’explicabilité coûteux dans des points de terminaison à faible latence.

Problème pratique : Scénario d’utilisation

Scénario : Acme Manufacturing exploite des flottes de capteurs distants avec une connectivité intermittente et utilise AWS IoT et S3 pour l’agrégation centralisée. Leur environnement ML AWS comprend SageMaker, IoT Core, Kinesis Data Streams et des appareils de périphérie (edge) compatibles Greengrass.

Défi : Fournir une détection d’anomalies à faible latence sur des sites distants lorsque la connectivité est intermittente, tout en collectant la télémétrie pour le réentraînement centralisé et la détection de dérive sans Direct Connect.

Approche recommandée :

  1. Déployez un modèle compact de détection d’anomalies compilé avec SageMaker Neo sur AWS IoT Greengrass sur les appareils de périphérie pour l’inférence locale en temps réel et les actions (alarmes locales, mise en mémoire tampon à court terme).
  2. Diffusez la télémétrie résumée et les indicateurs d’anomalie via AWS IoT Core vers Amazon Kinesis Data Streams, et utilisez Kinesis Data Firehose pour persister les données brutes et agrégées dans S3 (format parquet) pour le stockage centralisé.
  3. Construisez un SageMaker Pipeline qui ingère les lots de S3, exécute des tâches de traitement (Processing jobs avec Data Wrangler) pour calculer les lignes de base et l’ingénierie des caractéristiques, déclenche des HyperparameterTuningJobs si nécessaire, et enregistre les modèles validés dans le SageMaker Model Registry.
  4. Activez SageMaker Model Monitor sur le point de terminaison central et planifiez des tâches par lots qui comparent les distributions collectées en périphérie aux lignes de base de l’entraînement (PSI/KL), et utilisez SageMaker Ground Truth avec des alertes échantillonnées pour l’étiquetage humain afin de boucler la boucle.

Justification : L’inférence en périphérie via Greengrass + Neo assure des décisions à faible latence avec une connectivité intermittente ; Kinesis + Firehose garantit une ingestion fiable et ordonnée vers S3 pour le réentraînement ; SageMaker Pipelines et Model Registry fournissent un réentraînement reproductible, un versionnage et une promotion automatisée avec des vérifications de dérive pour maintenir la qualité du modèle.


Sécurité · Tous les domaines

Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Réussissez votre examen →

Parcourir Amazon →

Related guides

Accès tout-en-un

Un seul abonnement. Chaque examen.

Chaque plan débloque la recherche de réponses illimitée, les tests pratiques, les explications IA et la bibliothèque complète de ressources — en plus de 20 langues.

Mensuel
24.87
Just €0.83/day
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

Meilleur rapport qualité/prix
12 mois
179.87
Just €0.49/daySave 40%
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

✓ Plan gratuit inclus · ✓ Annulez à tout moment · ✓ Tous les plans débloquent le produit complet