Amazon MLA-C01: IA générative et modèles de fondation — Guide d'étude

Fait partie du AWS Machine Learning Engineer Associate MLA-C01 — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Amazon, ou passez des tests chronométrés sur ExamRoll.io.

Concept de base

Les modèles de fondation sont de grands réseaux pré-entraînés — généralement basés sur l’architecture transformer — qui fournissent des représentations génériques pour le langage, la vision ou le multimodal. La mise en production pratique nécessite de transformer ces capacités étendues en comportements spécifiques à une application par trois leviers orthogonaux : l’ingénierie de prompt (prompt engineering) au moment de l’inférence, la génération augmentée par récupération (RAG) pour ancrer les résultats dans des connaissances à jour ou spécifiques à un domaine, et la personnalisation du modèle par l’ajustement fin (fine-tuning) ou des techniques efficaces en paramètres. Amazon Bedrock fournit une voie gérée pour invoquer des modèles de fondation tiers et fournis par Amazon via une API unifiée, abstrayant la sélection du modèle tout en conservant le contrôle sur les entrées, les paramètres du modèle (temperature, top_p, max_output_tokens) et la gestion des réponses. SageMaker JumpStart complète Bedrock en empaquetant des artefacts de modèles pré-entraînés, des scripts d’entraînement et des recettes d’ajustement fin qui s’exécutent sur des conteneurs SageMaker Training ou Hugging Face, permettant des flux de travail d’adaptation reproductibles et l’intégration avec le registre de modèles.

L’ajustement fin (fine-tuning) se décline en plusieurs variantes qui arbitrent entre les besoins en calcul et en jeux de données d’une part, et la fidélité de l’adaptation d’autre part. L’ajustement fin complet met à jour tous les poids du modèle et produit souvent les meilleures performances pour une tâche spécifique, mais nécessite d’importantes flottes de GPU et du stockage pour les checkpoints. Les techniques d’ajustement fin efficace en paramètres (PEFT) telles que LoRA (adaptateurs de bas rang), les modules d’adaptateurs, ou QLoRA (adaptateurs de bas rang quantifiés) réduisent considérablement la mémoire GPU et le temps d’entraînement en injectant et en n’entraînant qu’un petit nombre de paramètres supplémentaires, compatibles avec l’entraînement SageMaker utilisant Hugging Face et bitsandbytes pour la quantification 8 bits/4 bits. L’apprentissage par renforcement à partir de la rétroaction humaine (RLHF) est un pipeline plus complexe : collecter des étiquettes de préférence humaine par paires, entraîner un modèle de récompense (une étape d’apprentissage supervisé utilisant SageMaker Training et un ModelPackage), et optimiser le modèle de politique avec du RL on-policy (PPO ou similaire) tout en stockant les rollouts et les checkpoints dans S3 et en surveillant les signaux de récompense avec SageMaker Debugger.

Les architectures RAG font le pont entre les modèles de fondation et des corpus à jour pour réduire les hallucinations. Le pipeline RAG typique transforme le texte de la requête en plongements vectoriels (embeddings) avec un modèle d’embeddings (API Bedrock Embeddings ou un embedder Hugging Face sur SageMaker), effectue une recherche vectorielle des plus proches voisins dans un index (Amazon OpenSearch Service avec k-NN, Amazon Kendra, ou des bases de données vectorielles tierces), récupère les k documents les plus pertinents, et conditionne le modèle de langage (LM) avec le contexte récupéré via des modèles de prompt et des paramètres de décodage contrôlés. La gestion de la fraîcheur et de la pertinence des données nécessite une ré-ingestion et une ré-indexation périodiques des sources en utilisant AWS Glue, AWS Lambda pour les mises à jour en streaming, ou AWS DMS pour les sources transactionnelles, et le stockage des métadonnées de provenance (source_id, document_id, ingestion_time) à côté des vecteurs pour l’auditabilité.

Services clés et configuration

Amazon Bedrock expose l’API InvokeModel où les requêtes incluent l’identifiant du modèle et les paramètres d’exécution : transmettez les en-têtes modelId, contentType et accept, un corps (body) contenant les prompts ou inputText, et des modelParameters tels que temperature, topP et maxOutputTokens. Utilisez des messages système et utilisateur structurés pour séparer les instructions basées sur les rôles et contraindre les formats de sortie ; imposez des séquences d’arrêt (stop sequences) et une valeur pour max_output_tokens afin de limiter la latence et les coûts. Pour la génération de plongements vectoriels (embeddings), utilisez le point de terminaison d’embeddings de Bedrock ou un conteneur d’inférence Hugging Face sur SageMaker et persistez les vecteurs dans OpenSearch, Kendra, ou une base de données vectorielle externe.

SageMaker JumpStart fournit des notebooks préconfigurés et des pipelines d’ajustement fin qui se connectent à CreateTrainingJob avec des paramètres d’API concrets : TrainingJobName, AlgorithmSpecification (TrainingImage, TrainingInputMode), RoleArn, InputDataConfig (S3Uri, DataSource), OutputDataConfig (S3OutputPath), ResourceConfig (InstanceType, InstanceCount, VolumeSizeInGB), et StoppingCondition (MaxRuntimeInSeconds). Pour la gouvernance des modèles, utilisez le SageMaker Model Registry et CreateModelPackage/CreateModelPackageGroup avec ApprovalStatus défini sur « PendingManualApproval » ; intégrez la promotion des modèles dans le CI/CD en utilisant l’attribut ApprovalStatus avec AWS CodePipeline ou AWS Step Functions et une action ManualApproval pour contrôler les déploiements. Pour la surveillance continue et la détection de biais, déployez SageMaker Model Monitor via CreateMonitoringSchedule avec MonitoringScheduleConfig et BaselineConfig ; utilisez SageMaker Clarify via les API ProcessingJob (ClarifyProcessor.run_pre_training_bias et run_post_training_bias) pour calculer les métriques de biais du jeu de données et produire des lignes de base (baselines) stockées dans S3.

Pour la recherche vectorielle et le RAG, choisissez la technologie d’indexation et de recherche en fonction de l’échelle et de la latence des requêtes. Amazon OpenSearch Service prend en charge le plugin k-NN et fournit des API REST ainsi qu’un contrôle d’accès fin ; Amazon Kendra offre une recherche sémantique d’entreprise avec des connecteurs pour S3, SharePoint et RDS. Utilisez les crawlers AWS Glue pour construire un Data Catalog central, et AWS Lake Formation pour appliquer un contrôle d’accès fin et un isolement des données d’entraînement sur S3, en veillant à ce que les politiques IAM, les politiques de compartiment (bucket policies) et le chiffrement (SSE-S3 ou SSE-KMS) soient appliqués.

Patrons de conception et compromis

Lors de la personnalisation des modèles de fondation, il faut choisir entre le fine-tuning hors ligne et l’ingénierie de prompt (prompt engineering) à l’exécution. Le fine-tuning complet maximise les performances pour les tâches spécialisées, mais augmente la complexité opérationnelle : les tâches d’entraînement nécessitent de grandes flottes de GPU, un entraînement distribué sur plusieurs nœuds (utilisez SageMaker DistributedDataParallel ou Horovod en Script Mode), la sauvegarde des points de contrôle (checkpointing) sur S3 via UploadDirectory, puis la quantification et la conversion pour une inférence efficace. Les approches PEFT telles que LoRA maintiennent la plupart des poids du modèle gelés, ce qui réduit considérablement le temps d’entraînement, permet des balayages d’hyperparamètres moins coûteux et simplifie la restauration (rollback) car le modèle de base reste intact. Pour l’inférence, les points de terminaison gérés par Bedrock allègent la charge opérationnelle pour les FM tiers, tandis que les points de terminaison en temps réel de SageMaker offrent un contrôle plus approfondi : utilisez les MultiModelEndpoints pour servir de nombreux modèles à partir d’une seule instance, Serverless Inference pour un trafic imprévisible, ou des points de terminaison provisionnés avec mise à l’échelle automatique (auto-scaling) et simultanéité provisionnée pour réduire les démarrages à froid (cold starts).

Le RAG introduit de la complexité pour maintenir l’index à jour et pour trouver un équilibre entre la récupération d’informations (retrieval) et l’hallucination. Un patron simple est la récupération hybride : exécutez d’abord une recherche vectorielle (sémantique), puis un filtre par mots-clés pour garantir la précision. Stockez les métadonnées des fragments de documents afin que l’étape de génération puisse citer ses sources et faciliter les vérifications de la fréquence des hallucinations par Model Monitor. Pour les applications sensibles à la latence, colocalisez le calcul des embeddings et l’index (inférence SageMaker + OpenSearch dans le même VPC) et utilisez l’indexation par plus proches voisins approximatifs (ANN) pour échanger le rappel (recall) contre de la vitesse.

Le RLHF présente une friction élevée mais est nécessaire lorsque l’alignement sur les valeurs humaines ou la sécurité est requis. Le pipeline nécessite des outils pour l’annotation, un entraînement de récompense reproductible avec les API SageMaker Estimator, et des optimiseurs RL stables (implémentations de PPO dans les familles RLlib ou Stable Baselines). Le coût et l’instabilité du RLHF doivent être mis en balance avec la capacité de corriger un comportement qui ne peut pas être encodé comme une perte statique.

Pièges courants et critères de décision

Une erreur fréquente consiste à se fier uniquement aux prompts pour corriger des erreurs systématiques qui nécessitent une adaptation au niveau du modèle ; les prompts peuvent aider mais ne remplacent pas le fine-tuning ou le RAG pour l’ancrage au domaine. Un autre piège est de sous-estimer la gouvernance : la mise en production de systèmes génératifs exige une traçabilité des modèles (SageMaker Model Registry), une détection automatique de la dérive (lignes de base de Model Monitor et Clarify), et un flux de travail d’approbation (ApprovalStatus + approbation manuelle avec CodePipeline). Pour les banques d’embeddings, choisir un index vectoriel sans métadonnées ni provenance rend les audits ultérieurs et l’analyse d’erreurs coûteux.

Décidez de l’hébergement du modèle en équilibrant le contrôle et la charge opérationnelle. Utilisez Bedrock lorsque vous souhaitez un accès géré à des modèles de fondation diversifiés et performants sans avoir à gérer la flotte d’inférence. Utilisez les points de terminaison SageMaker lorsque vous avez besoin de piles d’inférence personnalisées, d’une isolation VPC, ou d’une intégration complète avec Model Registry et Model Monitor. Pour les méthodes de fine-tuning, sélectionnez PEFT lorsque la taille du jeu de données est modeste et que l’itération rapide est importante ; choisissez le fine-tuning complet lorsque le domaine exige un changement de représentation profond et que vous disposez du budget GPU nécessaire.

Problème pratique : Scénario de cas d’usage

Entreprise fictive : AuroraPayments — défi : déployer un assistant de détection de fraude à faible latence et auditable, qui synthétise le contexte des transactions et les documents de politique pour expliquer les scores suspects et prend en charge les mises à jour contrôlées du modèle.

  1. Agrégation et stockage des données : utilisez AWS Glue pour crawler les journaux de transactions S3 et configurez AWS DMS pour répliquer les tables MySQL on-prem vers Amazon RDS ou S3. Enregistrez toutes les sources dans l’AWS Glue Data Catalog et appliquez les politiques Lake Formation. Justification : Glue fournit un ETL serverless et un catalogue unifié pour la récupération en aval, et Lake Formation assure l’isolation de l’accès à S3.

  2. Ingénierie des caractéristiques et détection d’anomalies : ingérez les caractéristiques dans SageMaker Feature Store pour une cohérence hors ligne/en ligne. Exécutez la détection d’anomalies automatisée à l’aide d’Amazon Lookout for Metrics sur les séries temporelles de transactions et affichez les tableaux de bord dans Amazon QuickSight. Justification : Feature Store garantit des caractéristiques reproductibles pour l’entraînement et le service ; Lookout for Metrics automatise la détection d’anomalies et QuickSight fournit la visualisation pour les analystes métier.

  3. Entraînement du modèle et gestion du déséquilibre : entraînez un classifieur XGBoost en utilisant l’algorithme XGBoost intégré de SageMaker avec des hyperparamètres et définissez scale_pos_weight sur (num_negative/num_positive) pour corriger le déséquilibre des classes. Utilisez SageMaker Training CreateTrainingJob avec une ResourceConfig ajustée à la taille de l’entraînement et activez le checkpointing S3 pour la tolérance aux pannes. Justification : XGBoost est efficace pour les tâches de fraude sur données tabulaires ; scale_pos_weight nécessite une charge opérationnelle minimale par rapport au suréchantillonnage synthétique.

  4. Registre de modèles, approbation et déploiement : enregistrez les artefacts du modèle dans SageMaker Model Registry avec CreateModelPackage/ModelPackageGroupName et définissez ApprovalStatus sur « PendingManualApproval ». Implémentez un CodePipeline qui déclenche une action d’approbation, puis déployez les versions approuvées sur des points de terminaison temps réel SageMaker avec des points de terminaison MultiModel ou des Provisioned Instances derrière un Auto Scaling. Justification : Model Registry maintient un versionnage centralisé et la gouvernance ; l’approbation manuelle via CodePipeline impose des déploiements autorisés.

  5. Explicabilité et RAG pour l’ancrage aux politiques : créez des embeddings des documents de politique avec Bedrock ou un embedder Hugging Face sur SageMaker, indexez-les dans Amazon OpenSearch k-NN avec des métadonnées, et implémentez un flux RAG où un prompt pour une transaction suspecte inclut les top-k extraits de politique récupérés ainsi qu’un modèle demandant au modèle de fondation de citer ses sources et de générer une explication lisible par l’homme. Justification : Le RAG ancre les explications dans des documents faisant autorité et OpenSearch fournit une recherche vectorielle scalable à l’intérieur du périmètre de sécurité.

  6. Surveillance et réentraînement : activez SageMaker Model Monitor avec une ligne de base issue de la validation initiale et planifiez des ProcessingJobs Clarify à la demande pour exécuter des vérifications de biais post-déploiement. Si Model Monitor signale une dérive (changement de distribution dans les caractéristiques ou changement d’étiquettes), déclenchez un SageMaker Pipeline qui exécute l’ingestion de données, réentraîne avec le fine-tuning LoRA si un encodeur de modèle de fondation est utilisé pour les caractéristiques textuelles, évalue, et place le nouveau modèle dans le registre en tant que PendingManualApproval. Justification : La surveillance continue avec des pipelines automatisés maintient la performance et la conformité du modèle tout en préservant le contrôle manuel sur les changements en production.


Sécurité · Tous les domaines · Optimisation des coûts pour les charges de travail ML

Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Réussissez votre examen →

Parcourir Amazon →

Related guides

Accès tout-en-un

Un seul abonnement. Chaque examen.

Chaque plan débloque la recherche de réponses illimitée, les tests pratiques, les explications IA et la bibliothèque complète de ressources — en plus de 20 langues.

Mensuel
24.87
Just €0.83/day
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

Meilleur rapport qualité/prix
12 mois
179.87
Just €0.49/daySave 40%
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

✓ Plan gratuit inclus · ✓ Annulez à tout moment · ✓ Tous les plans débloquent le produit complet