Amazon AIF-C01: Sécurité et confidentialité de l'IA — Guide d'étude

Fait partie du AWS AI Practitioner AIF-C01 — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Amazon, ou passez des tests chronométrés sur ExamRoll.io.

Protection des données et contrôle d’accès

La protection des données d’entraînement et d’inférence commence par un accès au moindre privilège. Utilisez des rôles IAM pour Amazon SageMaker, AWS Lambda et Amazon Bedrock avec des politiques affinées et des restrictions au niveau des ressources ; stockez les informations d’identification dans AWS Secrets Manager et évitez d’intégrer des secrets dans le code. Classez les données avec Amazon Macie et AWS Glue Data Catalog afin que seuls les jeux de données approuvés (et leurs sous-ensembles approuvés) entrent dans les pipelines d’entraînement. Pour les attributs sensibles, appliquez la détection et la rédaction ou la tokenisation des informations d’identification personnelle (PII) avec Comprehend avant le stockage ou l’indexation ; envisagez de remplacer les PII par des jetons réversibles lorsque la liaison est requise pour les flux de travail en aval. Appliquez des politiques de compartiment S3, bloquez l’accès public et exigez le chiffrement SSE-KMS pour les objets contenant des données sensibles. Utilisez des politiques de clé KMS et la rotation des clés pour contrôler qui peut déchiffrer les artefacts d’entraînement ou les points de contrôle du modèle. Les pièges courants pour les praticiens incluent l’octroi de rôles d’exécution SageMaker trop larges, l’oubli de restreindre l’accès aux préfixes S3 et le non-renouvellement des clés KMS ou des informations d’identification IAM. Les critères de décision doivent prendre en compte la sensibilité des données, la capacité à rédiger ou à synthétiser les entrées, et si l’accès direct du modèle aux PII brutes est strictement nécessaire. Lorsque les PII doivent être conservées pour l’utilité du modèle, préférez un traitement isolé avec des pistes d’audit contrôlées plutôt qu’un stockage ouvert.

Connectivité privée, chiffrement et gestion des clés

L’isolation réseau et les contrôles cryptographiques sont fondamentaux pour le ML en production. Déployez l’entraînement et l’hébergement SageMaker à l’intérieur de VPC en utilisant des points de terminaison VPC et AWS PrivateLink afin que les données ne transitent jamais par l’Internet public. Configurez des points de terminaison d’interface VPC pour S3, Secrets Manager et Bedrock (lorsque cela est pris en charge) et appliquez des politiques de point de terminaison pour restreindre le trafic aux principaux et préfixes approuvés. Chiffrez toutes les données en transit avec TLS et au repos avec SSE-KMS (S3) et le chiffrement EBS pour les instances d’entraînement. Utilisez AWS KMS pour la gestion centralisée des clés ; envisagez des clés multi-régions pour la reprise après sinistre et les opérations inter-régions, et restreignez les autorisations de déchiffrement (Decrypt) à l’aide des politiques de clé KMS. Pour les charges de travail hautement réglementées, utilisez AWS Nitro Enclaves pour isoler les opérations cryptographiques et l’attestation des artefacts du modèle sans exposer la mémoire de l’hôte. Les pièges courants incluent l’oubli de bloquer l’accès public S3 lors de l’utilisation de politiques de point de terminaison, le fait de laisser les métadonnées EC2 trop permissives, ou l’utilisation de clés KMS client sans contrôles d’accès explicites. Choisissez le chiffrement côté client si vous devez empêcher le déchiffrement côté AWS, et préférez SSE-KMS lorsque vous avez besoin d’une auditabilité d’accès affinée ainsi que d’une intégration avec les services AWS.

Journalisation, audit, gouvernance et explicabilité

Maintenez une observabilité de bout en bout : activez CloudTrail pour l’audit au niveau de l’API sur SageMaker, Bedrock, KMS et S3 ; diffusez les journaux vers CloudWatch et vers une archive centralisée et immuable pour la rétention et la conformité. Utilisez AWS Config pour enregistrer les configurations des ressources et détecter les dérives. Pour la traçabilité et la gouvernance spécifiques au ML, utilisez SageMaker Model Registry et SageMaker Experiments pour capturer les métadonnées du modèle, le versionnage, la provenance et l’historique de déploiement ; intégrez SageMaker Model Monitor pour détecter la dérive de concept (concept drift), l’asymétrie des données (data skew) et la dégradation de la qualité des prédictions. Pour la détection de biais et l’explicabilité, instrumentez les pipelines avec SageMaker Clarify pour les métriques de biais du jeu de données, SHAP ou les gradients intégrés pour l’attribution des caractéristiques (feature attribution), et produisez des fiches de modèle (model cards) documentant les données d’entraînement, les métriques d’évaluation et les limitations connues. Les pièges pour les praticiens incluent la journalisation des PII en texte clair dans CloudWatch, la non-corrélation des versions de modèle avec les métriques d’inférence, ou l’absence d’alertes automatisées sur les dérives. Les critères de décision doivent équilibrer les fenêtres de rétention par rapport au coût, et exiger que les résultats d’explicabilité soient lisibles par l’homme et stockés avec les métadonnées du modèle pour l’auditabilité et l’examen par des cliniciens/régulateurs le cas échéant.

Entraînement préservant la confidentialité, RAG, embeddings et considérations de sécurité pour Bedrock

Lorsque les modèles interagissent avec des corpus de données sensibles ou fournissent du contenu spécifique à l’utilisateur, appliquez des techniques de préservation de la confidentialité. Les mécanismes de confidentialité différentielle (DP) pendant l’entraînement peuvent limiter la contribution individuelle ; les schémas d’apprentissage fédéré peuvent conserver les enregistrements bruts sur site tout en partageant les mises à jour du modèle. Pour la génération augmentée par récupération (RAG), évitez d’indexer les PII brutes dans les banques de vecteurs ; pré-traitez avec une rédaction des PII ou stockez des pointeurs et appliquez une rédaction à la volée lors de la récupération. Les embeddings peuvent divulguer des informations sensibles — traitez les banques de vecteurs comme n’importe quelle base de données : chiffrez au repos (S3/EBS), restreignez l’accès via IAM et VPC, et envisagez de tokeniser les clés ou d’utiliser des filtres au moment de la requête. Bedrock fournit des garde-fous (guardrails) et des outils de modération pour détecter et bloquer les entrées/sorties nuisibles, et s’intègre avec les contrôles IAM et VPC ; appliquez les garde-fous comme une couche de défense en profondeur, mais ne vous y fiez pas comme unique contrôle. Les pièges courants incluent l’exposition de la base de données vectorielle via des points de terminaison ouverts, le non-rafraîchissement des index RAG entraînant des sorties obsolètes ou biaisées, et le fait de supposer que l’ajustement des prompts élimine les hallucinations. Choisissez entre le fine-tuning synchrone sur Bedrock et l’ingénierie de prompt à l’exécution en fonction de la latence, de la résidence des données et des besoins de gouvernance du modèle.

Problème pratique : Scénario de cas d’usage

Scénario : Horizon Media, un fournisseur de streaming, exploite un pipeline d’IA basé sur SageMaker ainsi qu’Amazon Bedrock pour des fonctionnalités d’assistant. Les journaux d’audience et les données de personnalisation résident dans des buckets S3 chiffrés dans la région eu‑west‑1, et les métadonnées de contenu quotidiennes sont indexées dans une banque de vecteurs OpenSearch pour le RAG.

Défi : Ils doivent fournir des recommandations personnalisées et un assistant conversationnel basé sur Bedrock tout en empêchant la fuite de PII dans les embeddings, en garantissant un traitement des données limité à la région, et en fournissant une traçabilité du modèle et des alertes de dérive auditables.

Approche recommandée :

  1. Configurer l’entraînement SageMaker et l’accès à Bedrock au sein d’un VPC en utilisant AWS PrivateLink et des points de terminaison d’interface VPC ; appliquer des politiques de point de terminaison S3 pour restreindre les préfixes de bucket.
  2. Utiliser Amazon Macie et Comprehend PII pour détecter et rédiger les PII avant la création des embeddings ; ne stocker que du texte rédigé ou des jetons réversibles dans la banque de vecteurs, chiffrés avec SSE-KMS.
  3. Enregistrer les modèles et les artefacts dans SageMaker Model Registry et suivre les expérimentations avec SageMaker Experiments ; activer Model Monitor pour la dérive des données et des prédictions, et CloudTrail/CloudWatch pour les journaux d’audit.
  4. Appliquer les garde-fous (guardrails) de Bedrock pour la modération de contenu, appliquer des politiques de clés IAM et KMS pour la résidence des données dans la région, et envisager la confidentialité différentielle ou les données synthétiques pour l’entraînement sur des échantillons très sensibles.

Justification : L’isolation réseau, le contrôle centralisé des clés, la rédaction des PII avant la création des embeddings, ainsi qu’une traçabilité et une surveillance complètes s’alignent sur les meilleures pratiques des professionnels pour minimiser les fuites, respecter la résidence des données et maintenir une gouvernance auditable dans les systèmes de ML en production.


IA responsable et gouvernance · Tous les domaines · Ingénierie des données pour le ML

Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Réussissez votre examen →

Parcourir Amazon →

Related guides

Accès tout-en-un

Un seul abonnement. Chaque examen.

Chaque plan débloque la recherche de réponses illimitée, les tests pratiques, les explications IA et la bibliothèque complète de ressources — en plus de 20 langues.

Mensuel
24.87
Just €0.83/day
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

Meilleur rapport qualité/prix
12 mois
179.87
Just €0.49/daySave 40%
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

✓ Plan gratuit inclus · ✓ Annulez à tout moment · ✓ Tous les plans débloquent le produit complet