Amazon DEA-C01: Catalogage des données et gestion des métadonnées — Guide d'étude

Fait partie du Amazon Data Engineer Associate DEA-C01 — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Amazon, ou passez des tests chronométrés sur ExamRoll.io.

Ce domaine couvre la couche de métadonnées qui rend les données découvrables, interrogeables et gouvernables sur une plateforme de données AWS. Un catalogage et une gestion des métadonnées efficaces réduisent les frictions pour l’analytique et garantissent que les consommateurs en aval peuvent trouver les schémas, les partitions, les politiques d’accès et la lignée des données. Les services AWS dans ce domaine — Glue Data Catalog, Glue Schema Registry, Lake Formation, l’intégration Athena et DataBrew — fournissent des outils complémentaires pour la découverte, l’évolution des schémas, la gouvernance et le profilage. Comprendre comment ces services interagissent, leurs détails de configuration et les modes de défaillance typiques est essentiel pour la fiabilité opérationnelle et la sécurité.

Structure et opérations d’AWS Glue Data Catalog

Le Glue Data Catalog est le référentiel de métadonnées centralisé et régional pour les bases de données, les tables, les partitions, les connexions et les classifieurs définis par l’utilisateur. Les primitives de base sont :

undefined

).

undefined

). Vous pouvez créer/mettre à jour via la console, l’API Glue ou CloudFormation ; par ex.,

undefined

.

undefined

) ou ajoutées explicitement (

undefined

).

Modèles opérationnels :

Critères de décision :

Découverte et évolution des schémas

Le Schema Registry et les schémas Glue prennent en charge Avro, JSON et Protobuf pour le streaming et les contrats producteur/consommateur à longue durée de vie. Fonctionnalités clés :

undefined

).

Modèles pratiques de configuration et d’évolution :

Critères de décision :

Lignée des données et gouvernance avec Lake Formation

Lake Formation s’appuie sur le Glue Data Catalog pour fournir un contrôle d’accès affiné, un audit et des contrôles de la lignée des données. Fonctionnalités principales :

undefined

.

Modèles de configuration :

Critères de décision :

Intégration d’Athena et du catalogue Glue

Athena s’appuie sur le Glue Data Catalog pour les métadonnées. Points d’intégration et leviers opérationnels courants :

Complément avec Glue DataBrew :

Critères de décision :

Pièges courants et critères de décision

Problème pratique : Scénario de cas d’usage

Acme Retail reçoit des fichiers de ventes horaires sur S3 avec des partitions par date/heure et les analystes interrogent les données dans Athena ; après le chargement, les utilisateurs constatent des échecs de requêtes et des résultats obsolètes car les partitions ne sont pas visibles dans le Glue Data Catalog.

  1. Implémentez une notification d’événement S3 PUT pour invoquer une fonction Lambda qui appelle aws glue batch-create-partition afin d’enregistrer immédiatement la nouvelle partition.
  2. Pour les données plus anciennes ou les remplissages (backfills), planifiez une requête Athena qui exécute MSCK REPAIR TABLE db.sales_hourly; ou exécutez un aws glue batch-create-partition ciblé pour des plages connues.
  3. Si les partitions suivent une convention de nommage stricte par date/heure, activez la projection de partitions sur la table Glue (définissez projection.enabled=true et définissez les propriétés year/month/day/hour) pour éliminer les coûts de rafraîchissement du catalogue.
  4. Ajoutez des LF-Tags pour la sensibilité à la table et accordez aux analystes des autorisations Lake Formation afin que les requêtes Athena soient autorisées et gouvernées.
  5. Utilisez Glue DataBrew pour profiler les nouveaux fichiers horaires dans un environnement de pré-production (staging) afin de détecter la dérive de schéma ; si des changements de schéma sont trouvés, enregistrez de nouvelles versions de schéma dans le Glue Schema Registry et validez la compatibilité avant le déploiement en production.

Justification : l’enregistrement automatique ou la projection des partitions supprime le décalage de métadonnées qui cause l’échec des requêtes Athena ; coupler cela avec la gouvernance Lake Formation assure un accès sécurisé, et le profilage piloté par DataBrew détecte tôt la dérive de schéma, tandis que le Glue Schema Registry protège les consommateurs de streaming et de batch contre les changements de schéma incompatibles.


Stockage des données et architecture de lac de données · Tous les domaines · Transformation et traitement des données

Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Réussissez votre examen →

Parcourir Amazon →

Related guides

Accès tout-en-un

Un seul abonnement. Chaque examen.

Chaque plan débloque la recherche de réponses illimitée, les tests pratiques, les explications IA et la bibliothèque complète de ressources — en plus de 20 langues.

Mensuel
24.87
Just €0.83/day
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

Meilleur rapport qualité/prix
12 mois
179.87
Just €0.49/daySave 40%
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

✓ Plan gratuit inclus · ✓ Annulez à tout moment · ✓ Tous les plans débloquent le produit complet