Amazon AIF-C01: Concepts de l'IA générative — Guide d'étude
Fait partie du AWS AI Practitioner AIF-C01 — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Amazon, ou passez des tests chronométrés sur ExamRoll.io.
Modèles de fondation, tokens, embeddings et fondamentaux du multimodal
Les modèles de fondation sont de grands réseaux de neurones pré-entraînés qui offrent de puissantes capacités générales pour le texte, les images et d’autres modalités. Les exemples disponibles via AWS incluent l’accès via Amazon Bedrock aux modèles Titan et à d’autres modèles de fournisseurs, ainsi que les environnements SageMaker pour l’entraînement et l’hébergement de modèles personnalisés. Les tokens (jetons) sont les éléments atomiques — sous-mots ou caractères — que les LLM utilisent pour les entrées et les sorties ; la tokenisation (segmentation en jetons) détermine l’utilisation de la fenêtre de contexte, le coût et le risque de troncature. Les embeddings (plongements vectoriels) sont des vecteurs numériques denses qui encodent la signification sémantique et servent de liant pour la recherche par similarité, le clustering et la récupération en aval ; les embeddings peuvent être générés par les modèles Bedrock ou par des modèles hébergés sur SageMaker. Les modèles multimodaux acceptent et relient le texte, les images et l’audio ; les briques de base typiques sur AWS incluent Amazon Rekognition pour l’extraction de caractéristiques visuelles, Amazon Textract pour les documents numérisés, et Amazon Transcribe pour la conversion audio-texte, les modèles Bedrock ou SageMaker étant utilisés pour fusionner les modalités. Les compromis clés pour les praticiens incluent le choix entre l’ajustement fin (fine-tuning) d’un modèle de fondation (coût plus élevé, délai plus long, meilleur alignement sur la tâche) et l’ingénierie des prompts (prompt-engineering) et le RAG (plus rapide, moins coûteux, plus sûr pour la confidentialité des données). Les pièges courants incluent l’ignorance des limites de tokens lors de la construction des prompts, l’oubli de versionner les embeddings ou les index, et la sous-estimation des besoins de prétraitement pour les entrées d’images et de documents.
Ingénierie des prompts, contrôles de modèle et techniques de raisonnement
L’ingénierie des prompts (prompt engineering) structure les instructions et le contexte pour obtenir des sorties fiables ; les prompts efficaces séparent les instructions système (rôle, garde-fous), le contenu utilisateur et les exemples optionnels en few-shot. Utilisez des prompts système concis pour définir le style, les contraintes et le format de sortie, et stockez des modèles canoniques pour éviter toute dérive. L’ajustement des paramètres d’inférence tels que la température (temperature), top-p et max_tokens dans Bedrock ou SageMaker influence la créativité et le déterminisme — une température plus basse et un top-p plus étroit produisent des réponses plus cohérentes au détriment de la créativité. Les techniques de raisonnement incluent la chaîne de pensée (chain-of-thought) (raisonnement intermédiaire explicite pour améliorer les tâches multi-étapes), l’auto-cohérence (self-consistency) (échantillonner plusieurs chemins de raisonnement et agréger), et les boucles de vérification (demander au modèle de vérifier ou de citer ses sources). Les pièges courants sont l’injection de prompt (des entrées non fiables altérant le comportement du système), des exemples few-shot fragiles qui sur-apprennent le style plutôt que l’intention, et la négligence de journaliser les prompts à des fins d’audit. Critères de décision pour les techniques : utilisez la chaîne de pensée pour un raisonnement complexe lorsque la transparence est importante, mais ajoutez une vérification lorsque les résultats ont des conséquences dans le monde réel ; préférez des réglages déterministes pour les interfaces utilisateur en production afin de garantir la répétabilité.
Génération Augmentée par Récupération (RAG), bases de données vectorielles, agents et architectures
Le RAG (Retrieval-Augmented Generation) couple une couche de récupération (retrieval) avec un modèle génératif : indexer les documents, calculer les embeddings, effectuer une recherche par similarité pour récupérer le contexte, puis conditionner le LLM sur les passages récupérés. Sur AWS, les sources de documents se trouvent généralement dans Amazon S3, l’extraction utilise Textract ou des pipelines personnalisés, les embeddings sont générés via Bedrock ou SageMaker, et les vecteurs sont stockés dans Amazon OpenSearch Service avec k-NN ou dans des bases de données vectorielles spécialisées construites sur DynamoDB ou OpenSearch ; Amazon Kendra peut être utilisé lorsque la recherche sémantique d’entreprise et des connecteurs sont nécessaires. Les agents sont des contrôleurs basés sur des LLM qui décident quand appeler des outils — recherche, requêtes de base de données, calculatrices — et peuvent être implémentés en orchestrant les appels de modèle avec AWS Lambda ou Step Functions pour exécuter les outils en toute sécurité. Les modèles d’architecture incluent le RAG synchrone pour les chatbots et le RAG asynchrone par lots pour les tâches de résumé (Athena ou EMR pour prétraiter de grands corpus). Pièges pour les praticiens : des index obsolètes (ne pas rafraîchir les embeddings), l’inclusion excessive de contexte long qui dépasse les fenêtres de tokens, et l’oubli d’inclure des liens de provenance pour le contenu récupéré. Le choix entre Kendra et OpenSearch se fait en fonction des connecteurs, de la sécurité et du besoin de classement sémantique (semantic ranking).
Hallucinations, biais, explicabilité, surveillance et gouvernance
Les hallucinations se produisent lorsque les modèles fabriquent des faits qui semblent plausibles mais sont incorrects ; les stratégies d’atténuation se concentrent sur l’ancrage des réponses (RAG), la citation explicite des sources récupérées, les modèles de vérification qui contrôlent la véracité des sorties, et la révision par un humain (human-in-the-loop) pour les domaines à haut risque. Le biais provient de données d’entraînement ou de distributions d’étiquettes asymétriques ; utilisez Amazon SageMaker Clarify pour détecter les biais dans les jeux de données, examiner l’importance des caractéristiques (feature importances) et produire des artefacts d’explicabilité. Pour la performance et la dérive du modèle, déployez Amazon SageMaker Model Monitor afin de détecter la dérive des données et des prédictions, journalisez les entrées/sorties d’inférence dans CloudWatch et S3 à des fins d’audit, et maintenez la provenance des prompts et des sources de récupération. L’évaluation doit combiner des métriques techniques (précision/rappel, F1, mAP pour la détection, ROUGE pour la synthèse, perplexité le cas échéant) avec des métriques centrées sur l’humain comme l’utilité, la sécurité et la latence. Les pratiques de gouvernance concrètes incluent le red-teaming des sorties, les filtres de contenu automatisés, la détection et l’anonymisation des PII avec Amazon Comprehend PII, le versionnage des modèles et des embeddings, et la documentation de l’usage prévu et des limitations. Les pièges courants incluent le fait de se fier uniquement à des tests synthétiques, une journalisation insuffisante pour la conformité, et l’omission de l’atténuation des biais avant le déploiement dans des contextes réglementés.
Problème pratique : Scénario d’utilisation
Scénario : MedData Analytics exploite un assistant de diagnostic interne utilisant Amazon Bedrock pour la génération, des manuels pour les patients et des rapports d’imagerie stockés dans Amazon S3, ainsi qu’un pipeline d’entraînement SageMaker pour les expérimentations de modèles. Ils doivent fournir des suggestions de diagnostic transparentes et vérifiables tout en minimisant les hallucinations et les biais pour les cliniciens.
Défi : Ancrer les sorties du modèle dans des documents de confiance, garantir l’explicabilité et les vérifications de biais, et créer un pipeline RAG de production qui maintient la provenance et la supervision humaine.
Approche recommandée :
- Utilisez Amazon Textract pour extraire le texte structuré des PDF et Amazon Comprehend PII pour anonymiser les champs sensibles ; stockez les documents nettoyés dans Amazon S3 et suivez les versions avec le balisage d’objet (object tagging).
- Générez des embeddings avec un modèle d’embedding Amazon Bedrock (ou un encodeur hébergé sur SageMaker), indexez les vecteurs dans Amazon OpenSearch Service avec k-NN, et stockez les métadonnées dans DynamoDB pour les liens de provenance.
- Construisez une orchestration RAG où Lambda (ou Step Functions) récupère les passages top_k, assemble un modèle de prompt système, et appelle Amazon Bedrock pour la génération avec une température basse et des instructions explicites de « citer les sources ».
- Appliquez SageMaker Clarify sur les données d’entraînement/d’étiquetage pour détecter les biais, utilisez SageMaker Model Monitor pour les alertes de dérive, journalisez les prompts et les ID de récupération dans CloudWatch/S3, et acheminez les sorties à haut risque via Amazon A2I pour une révision par un clinicien.
Justification : L’ancrage des sorties via RAG et la citation explicite des sources réduisent les hallucinations ; la combinaison de Clarify, Model Monitor et de la révision humaine fournit l’explicabilité, la détection de biais et une gouvernance opérationnelle sûre, conformément aux meilleures pratiques du secteur.
← Fondamentaux de l’IA et du ML · Tous les domaines · Services IA →
Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Réussissez votre examen →