Amazon AIF-C01: Ingénierie des données pour le ML — Guide d'étude

Fait partie du AWS AI Practitioner AIF-C01 — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Amazon, ou passez des tests chronométrés sur ExamRoll.io.

Collecte, étiquetage, versionnage et gouvernance des données

La collecte d’ensembles de données représentatifs et auditables est l’étape fondamentale de tout projet de ML. Utilisez Amazon S3 comme magasin central durable avec S3 Versioning et le verrouillage d’objet activés pour préserver les entrées brutes et capturer la provenance. Pour l’ingestion et le catalogage structurés, enregistrez les ensembles de données dans le AWS Glue Data Catalog et appliquez un contrôle d’accès affiné à l’aide de Lake Formation. Lorsque l’étiquetage humain est nécessaire, Amazon SageMaker Ground Truth fournit des flux de travail intégrés, une interface utilisateur d’annotation et des boucles d’apprentissage actif qui réduisent les coûts d’étiquetage tout en créant des métadonnées sur l’accord et la confiance des étiqueteurs. Les pièges courants incluent la collecte d’échantillons biaisés ou non représentatifs, l’incapacité à enregistrer la lignée et les règles d’étiquetage, et des contrôles de qualité d’étiquettes insuffisants ; atténuez ces risques en stockant des audits d’étiquetage, en ré-étiquetant à l’aveugle des sous-ensembles et en utilisant des heuristiques de consolidation des étiquettes. Les décisions en matière de confidentialité et de conformité orientent l’architecture : utilisez le chiffrement côté serveur S3 avec des CMK gérées par KMS, restreignez l’accès avec des politiques IAM et des points de terminaison VPC (AWS PrivateLink), et effectuez la détection et l’anonymisation des PII avec Amazon Comprehend avant de partager les données pour l’entraînement des modèles. Pour les programmes de longue durée, capturez des instantanés (snapshots) des ensembles de données, étiquetez-les avec des ID d’ensemble de données et suivez les expérimentations avec Amazon SageMaker Experiments ou un outil externe comme DVC pour permettre un entraînement reproductible et des rapports réglementaires.

Prétraitement, ingénierie des caractéristiques et EDA

Les transformations et les caractéristiques déterminent la capacité d’un modèle à généraliser. Utilisez AWS Glue ou Amazon SageMaker Data Wrangler pour profiler, nettoyer et normaliser les données, et effectuez une analyse exploratoire itérative des données (EDA) avec Amazon QuickSight ou des notebooks Jupyter hébergés dans Amazon SageMaker Studio. Pour la gestion des caractéristiques en production, adoptez Amazon SageMaker Feature Store afin d’assurer un calcul cohérent des caractéristiques hors ligne et en ligne et d’éviter le décalage entraînement/service (train/serve skew) ; stockez les caractéristiques brutes et dérivées séparément et enregistrez la logique de création des caractéristiques. Les pipelines de séries temporelles et de streaming devraient s’appuyer sur Amazon Kinesis ou l’ETL en streaming d’AWS Glue pour un rafraîchissement des caractéristiques à faible latence. Les pièges typiques incluent la fuite de données (data leakage) — où des informations futures s’infiltrent dans l’entraînement — la gestion incorrecte des valeurs manquantes, et la non-concordance entre les caractéristiques d’entraînement hors ligne et les caractéristiques de service en ligne. Les critères de décision lors de la conception des pipelines dépendent du compromis entre la fraîcheur des données et le coût : choisissez l’ETL par lots pour les recalculs historiques lourds, le streaming pour la personnalisation en temps quasi réel, et des architectures hybrides lorsque des caractéristiques en ligne à faible latence sont requises. Automatisez les contrôles de validation et l’application des schémas dans Glue ou dans le cadre des tâches de SageMaker Processing pour détecter rapidement la dérive de schéma (schema drift).

Plongements (embeddings), augmentation, données synthétiques et ensembles de données pour les modèles de fondation

Les plongements (embeddings) convertissent le texte, les images ou les entrées multimodales en vecteurs denses qui capturent les relations sémantiques ; ils alimentent la recherche sémantique, la génération augmentée par récupération (RAG) et le clustering. Construisez un modèle de génération augmentée par récupération (RAG) où vous générez des plongements avec Amazon Bedrock ou des encodeurs hébergés sur SageMaker, stockez les vecteurs dans Amazon OpenSearch Service (k-NN), Amazon Kendra ou un magasin de vecteurs géré, et récupérez le contexte pour conditionner le modèle de fondation. L’augmentation de données et la génération de données synthétiques sont pratiques lorsque les exemples réels sont rares : utilisez des modèles génératifs dans SageMaker pour créer des paraphrases, des transformations d’images (via Albumentations ou SageMaker Processing) ou des enregistrements synthétiques préservant la confidentialité. Méfiez-vous de la dépendance excessive aux données synthétiques — une faible fidélité peut introduire un décalage de distribution (distribution shift) et surajuster les modèles à des artefacts. Pour les ensembles de données d’entraînement de modèles de fondation (FM), sélectionnez des exemples de haute qualité, standardisez les formats avec des modèles de prompt (prompt templates) et versionnez chaque instantané d’ensemble de données dans S3. Pour les données privées utilisées avec des modèles de fondation tiers, préférez une approche de fine-tuning privé (en important le calcul dans un VPC) ou déployez des pipelines de récupération seule qui n’envoient qu’un contexte non sensible au modèle de fondation tout en conservant les documents sources dans un magasin de vecteurs sécurisé ; appliquez l’anonymisation et le masquage au niveau du token pour éviter les fuites. L’ingénierie de prompt (prompt engineering) et les modèles d’instructions (prompts système) sont essentiels pour façonner les réponses du modèle ; ajustez la température, top_k ou top_p en fonction du déterminisme et de la créativité requis.

Évaluation, déploiement, surveillance et gestion du cycle de vie

L’évaluation doit être explicite, en utilisant des métriques alignées sur les objectifs métier : les tâches de régression utilisent le RMSE ou le MAE, la classification binaire évalue la précision/le rappel/le F1 et la ROC AUC, et la synthèse de texte utilise les variantes de ROUGE. Effectuez une validation et une validation croisée pendant la phase d’évaluation et réservez un jeu de données de test aveugle pour l’acceptation finale. Déployez à l’aide des points de terminaison Amazon SageMaker (inférence en temps réel ou sans serveur) ou d’Amazon Bedrock pour le service géré de modèles de fondation (FM) ; optimisez la latence en sélectionnant des modèles distillés plus petits, en activant les points de terminaison multi-modèles ou en utilisant SageMaker Serverless Inference pour un trafic imprévisible. Surveillez les performances et la dérive des données en production avec Amazon SageMaker Model Monitor et configurez des alertes en cas de dégradation des métriques ; utilisez des déploiements canary ou bleu/vert pour limiter les risques. Le contrôle d’accès pour l’utilisation des modèles est appliqué à l’aide des politiques de rôle IAM, des autorisations au niveau des ressources et de l’isolation réseau. Les pièges pour les praticiens incluent le choix de la mauvaise métrique (la précision pour les classes déséquilibrées), l’ignorance de la dérive de concept et l’échec de l’instrumentation des données d’entraînement et des journaux d’inférence pour l’auditabilité. Utilisez le CI/CD pour le ML avec SageMaker Pipelines pour standardiser la cadence de réentraînement, maintenir la cohérence du versionnage des jeux de données et des modèles, et conserver une piste d’audit défendable pour la conformité.

Problème pratique : Scénario de cas d’utilisation

Scénario : BrightCart, une chaîne d’épicerie en ligne, modernise son système d’inventaire sur site (on-prem) vers AWS et souhaite un chatbot d’IA générative qui réponde aux questions des clients et renvoie les emplacements d’inventaire en direct tout en protégeant les données des clients et de l’inventaire conformément aux règles de conformité. Leur environnement d’IA sur AWS comprend S3 pour les jeux de données, Amazon RDS pour l’inventaire transactionnel, SageMaker Studio pour le développement, un accès à Bedrock pour les modèles de fondation et un réseau VPC.

Défi : Construire un chatbot privé à faible latence, activé par RAG, qui récupère l’inventaire actuel et évite d’exposer des données sensibles ou de déclencher des hallucinations.

Approche recommandée :

  1. Provisionnez un VPC privé et configurez des points de terminaison AWS PrivateLink pour Bedrock et SageMaker ; stockez les documents de produits canoniques et les instantanés d’inventaire dans S3 avec un chiffrement côté serveur (KMS) et activez le versionnage S3.
  2. Calculez en continu les embeddings à partir des documents de produits avec un encodeur Bedrock ou un modèle SageMaker dans un sous-réseau privé, et stockez les vecteurs dans Amazon OpenSearch Service avec k-NN pour une récupération rapide des plus proches voisins ; conservez l’inventaire en direct dans Amazon RDS et fournissez un connecteur d’exécution sécurisé pour la récupération.
  3. Mettez en œuvre un pipeline de génération augmentée par la récupération (RAG) où l’application interroge d’abord OpenSearch pour obtenir du contexte, puis appelle Bedrock avec un modèle de prompt système qui inclut le contexte récupéré et des instructions de sécurité explicites ; assainissez les entrées utilisateur via la validation des entrées et utilisez Amazon Comprehend pour détecter les PII (informations personnelles identifiables) et les expurger avant la récupération.
  4. Déployez le chatbot derrière un Application Load Balancer, servez le modèle de fondation (FM) via Bedrock avec une passerelle API dans le VPC, activez la journalisation vers CloudWatch avec un accès restreint, et surveillez les réponses du modèle et la dérive avec SageMaker Model Monitor et des audits humains périodiques.

Justification : Cette approche utilise un modèle RAG pour minimiser l’exposition des données sensibles, tire parti du réseau privé et de KMS pour la conformité, sépare l’inventaire en direct du contexte du modèle pour plus de précision, et applique une surveillance et des vérifications avec intervention humaine pour contrôler les hallucinations et garantir une fiabilité continue.


Sécurité et confidentialité de l’IA · Tous les domaines · Entraînement

Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Réussissez votre examen →

Parcourir Amazon →

Related guides

Accès tout-en-un

Un seul abonnement. Chaque examen.

Chaque plan débloque la recherche de réponses illimitée, les tests pratiques, les explications IA et la bibliothèque complète de ressources — en plus de 20 langues.

Mensuel
24.87
Just €0.83/day
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

Meilleur rapport qualité/prix
12 mois
179.87
Just €0.49/daySave 40%
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

✓ Plan gratuit inclus · ✓ Annulez à tout moment · ✓ Tous les plans débloquent le produit complet