Amazon AIF-C01: Entraînement, évaluation et optimisation des modèles — Guide d'étude
Fait partie du AWS AI Practitioner AIF-C01 — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Amazon, ou passez des tests chronométrés sur ExamRoll.io.
Stratégies d’entraînement et architecture des données
La conception des stratégies d’entraînement commence par le choix entre un entraînement à partir de zéro, un ajustement fin (fine-tuning) d’un modèle pré-entraîné, ou l’application de techniques de few-shot/prompting. Pour les jeux de données étiquetés de petite taille, l’apprentissage par transfert sur un modèle pré-entraîné (modèles Amazon Bedrock ou SageMaker JumpStart) accélère la convergence et améliore la généralisation ; pour les corpus volumineux spécifiques à un domaine, un entraînement complet sur SageMaker Training avec des instances distribuées (Horovod ou entraînement distribué géré par SageMaker) peut être justifié. L’architecture des données est cruciale : stockez les données brutes et traitées dans Amazon S3, organisez les caractéristiques (features) dans Amazon SageMaker Feature Store, transformez-les avec AWS Glue ou SageMaker Processing, et étiquetez-les avec Amazon SageMaker Ground Truth. Assurez la sécurité et la confidentialité avec des points de terminaison VPC, le chiffrement KMS et des connecteurs Bedrock privés lors de l’ajustement fin sur des données sensibles. Les pièges courants incluent la fuite d’étiquettes (label leakage) provenant d’informations futures, la fuite temporelle pour les problèmes temporels, et un échantillonnage déséquilibré qui biaise les métriques. Les critères de décision doivent prendre en compte la taille du jeu de données, la qualité des étiquettes, les contraintes de latence et de coût, ainsi que les exigences réglementaires ; choisissez l’entraînement spot pour réduire les coûts, mais validez la reproductibilité et la gestion des points de contrôle (checkpointing). Utilisez SageMaker Experiments pour suivre les exécutions et le Model Registry pour versionner les artefacts, permettant des comparaisons reproductibles et des restaurations (rollbacks) sécurisées.
Métriques d’évaluation et de validation
La sélection des métriques doit être guidée par l’objectif métier plutôt que par familiarité. Pour la classification, privilégiez la précision lorsque les faux positifs sont coûteux (alertes de fraude) et le rappel lorsque manquer des positifs est dangereux (dépistage de maladies). Pour la recherche d’information et le résumé, ROUGE et BLEU mesurent le chevauchement des n-grammes et la fluidité, tandis qu’une évaluation humaine ou des métriques de factualité sont nécessaires pour les réponses critiques en termes de conformité. Utilisez des stratégies de validation robustes : validation croisée stratifiée (stratified k-fold) ou des divisions tenant compte des séries temporelles, un jeu de test de holdout dédié, et des déploiements shadow ou canary pour valider les performances en production sous un trafic réel. Le calibrage du modèle et la sélection du seuil nécessitent souvent des courbes précision-rappel ou une analyse ROC-AUC, ainsi que des méthodes de calibrage post-entraînement. Considérez des métriques orientées métier (erreur pondérée par le coût, augmentation de la rétention client) en parallèle des métriques techniques. Les pièges courants pour les praticiens incluent une dépendance excessive à l’exactitude (accuracy) avec des classes déséquilibrées et l’évaluation de la NLG uniquement avec BLEU/ROUGE lorsque la cohérence factuelle est importante. Définitions des métriques de référence :
- Accuracy (Exactitude) : proportion de prédictions correctes.
- Precision (Précision) : vrais positifs divisés par les positifs prédits.
- Recall (Rappel) : vrais positifs divisés par les positifs réels.
- Score F1 : moyenne harmonique de la précision et du rappel.
- ROC AUC : aire sous la courbe de caractéristique de fonctionnement du récepteur (receiver operating characteristic).
- BLEU : métrique de chevauchement de n-grammes basée sur la précision pour les tâches de type traduction.
- ROUGE : métrique de chevauchement de n-grammes orientée rappel pour le résumé.
Surapprentissage, sous-apprentissage, dérive et explicabilité
Le surapprentissage (overfitting) survient lorsque les modèles mémorisent le bruit des données d’entraînement ; le sous-apprentissage (underfitting) se produit lorsque les modèles ne parviennent pas à capturer le signal. Les mesures d’atténuation incluent l’arrêt précoce (early stopping), la régularisation (L1/L2), le dropout pour les réseaux de neurones, l’augmentation de données et les méthodes d’ensemble (ensembling). Pour les problèmes tabulaires, l’ingénierie des caractéristiques (feature engineering) et l’élagage (pruning) réduisent la variance ; pour les LLM, l’ajustement fin sélectif ou le prompt tuning évitent l’oubli catastrophique. La dérive du modèle (model drift) se manifeste par une dérive des covariables (covariate drift), soit un changement dans la distribution des entrées, ou une dérive de concept (concept drift), soit des changements dans la relation avec les étiquettes. Mettez en œuvre une surveillance continue avec Amazon SageMaker Model Monitor pour détecter la dérive des données et des prédictions, et orchestrez le réentraînement périodique avec SageMaker Pipelines ou des workflows événementiels utilisant AWS Lambda et Step Functions. Pour les environnements réglementés, appliquez des outils d’explicabilité et d’équité : SageMaker Clarify fournit l’importance des caractéristiques, des métriques de biais et des rapports avant/après entraînement ; SHAP et LIME, intégrés dans les pipelines d’inférence, offrent des explications locales. Les pièges courants incluent la confusion entre les problèmes de qualité des données et la dégradation du modèle, le report du réentraînement jusqu’à ce que les performances tombent en dessous des seuils métier, et l’échec de la journalisation des entrées/sorties pour l’analyse des causes profondes. Concevez une revue avec intervention humaine (human-in-the-loop) en utilisant Amazon Augmented AI (A2I) pour les prédictions à faible confiance ou à haut risque.
Optimisation, réglage des hyperparamètres et gestion du cycle de vie
Le réglage des hyperparamètres et la stratégie de déploiement déterminent si un modèle atteint les objectifs de précision, de latence et de coût. Utilisez SageMaker Automatic Model Tuning pour exécuter des recherches bayésiennes, aléatoires ou hyperband, et des tâches de réglage en warm-start (démarrage à chaud) lorsque vous souhaitez une amélioration itérative sans réexplorer les régions peu performantes. Choisissez la stratégie de recherche en fonction de la dimensionnalité et du budget de calcul : la recherche par grille (grid) pour les espaces discrets de petite taille, la recherche aléatoire (random) pour une couverture large, et la recherche bayésienne pour une convergence efficace. Optimisez pour les contraintes opérationnelles en effectuant un profilage avec SageMaker Debugger pour collecter les tenseurs et les règles qui indiquent des gradients évanescents ou des goulots d’étranglement, et sélectionnez les types d’instances en fonction des besoins en mémoire et en CPU/GPU. Le fine-tuning (réglage fin) des modèles de fondation dans Bedrock ou via SageMaker doit prendre en compte des techniques efficaces en termes de paramètres (couches d’adaptation, prompt tuning) pour maîtriser les coûts et réduire les risques de modification du comportement du modèle de base. Pour le déploiement, enregistrez les modèles dans SageMaker Model Registry, créez une CI/CD avec CodePipeline et SageMaker Projects, et servez-les avec des SageMaker Endpoints ou l’inférence serverless en fonction du trafic. Les pièges courants incluent la recherche de gains métriques marginaux à un coût disproportionné, la négligence du calibrage et du score de confiance (ce qui conduit à des déclencheurs de révision humaine fragiles), et l’oubli de versionner les jeux de données en même temps que les modèles ; intégrez la traçabilité (lineage) des jeux de données dans Feature Store et Glue Catalog pour maintenir la reproductibilité.
Problème pratique : Scénario de cas d’usage
Scénario : FinBank, une entreprise de services financiers de taille moyenne, exécute des modèles sur AWS et stocke les métadonnées des transactions et des clients dans S3 et SageMaker Feature Store. Elle utilise Bedrock pour un assistant génératif et SageMaker pour des modèles prédictifs.
Défi : Le modèle de prédiction du churn (attrition) montre une dégradation de ses performances après une semaine de données de production, et l’équipe a besoin d’un plan contrôlé pour mesurer la dérive (drift), mettre à jour le modèle et garantir la conformité avec les exigences d’explicabilité.
Approche recommandée :
- Déployez Amazon SageMaker Model Monitor pour capturer les distributions des caractéristiques (features), les résumés des prédictions, et détecter la dérive des covariables et des prédictions par rapport au jeu de données de référence (baseline).
- Si une dérive est détectée, déclenchez un SageMaker Pipeline pour exécuter la validation des données (Glue et AWS Data Wrangler), rééquilibrer ou augmenter les données, et créer une tâche de réentraînement en utilisant SageMaker Training avec le réglage des hyperparamètres en Warm-Start.
- Avant le déploiement, exécutez SageMaker Clarify pour l’analyse de l’équité (fairness) et de l’importance des caractéristiques (feature importance) et générez des rapports d’explicabilité ; acheminez les prédictions à faible confiance vers les flux de travail de révision humaine d’Amazon Augmented AI (A2I).
- Enregistrez le nouveau modèle dans SageMaker Model Registry, déployez-le sur un SageMaker Endpoint en mode canary, et effectuez des tests en shadow traffic (trafic fantôme) suivis d’un déploiement progressif avec des alarmes CloudWatch sur les indicateurs de performance clés (KPIs) de l’entreprise.
Justification : La surveillance continue avec Model Monitor détecte la dérive de manière précoce ; les pipelines automatisés garantissent la reproductibilité et un réentraînement rentable, tandis que Clarify et A2I fournissent des explications de niveau conformité et une supervision humaine alignées sur les meilleures pratiques AWS AI Practitioner.
← Ingénierie des données pour le ML · Tous les domaines · MLOps et déploiement →
Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Réussissez votre examen →