Amazon DEA-C01: Qualité, validation et observabilité des données — Guide d'étude

Fait partie du Amazon Data Engineer Associate DEA-C01 — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Amazon, ou passez des tests chronométrés sur ExamRoll.io.

Ce domaine couvre les pratiques de bout en bout et les services AWS utilisés pour garantir l’exactitude des données, détecter les anomalies et maintenir la fiabilité des pipelines. Une validation et une observabilité solides réduisent les défauts en aval, permettent de respecter les SLA et autorisent un retraitement sécurisé. Les ingénieurs de données doivent combiner Glue Data Quality, des frameworks de validation, la détection d’anomalies CloudWatch, les DLQ et une conception idempotente pour construire des pipelines robustes.

Règles et évaluation d’AWS Glue Data Quality

Glue Data Quality utilise des ensembles de règles (rulesets) en Data Quality Definition Language (DQDL) pour définir des assertions sur les jeux de données (nombre de lignes, seuils de valeurs nulles, unicité, vérifications SQL personnalisées). Créez des ensembles de règles dans la console ou avec la CLI (exemple de commande : aws glue create-data-quality-ruleset --name MyRuleset --rules file://dqdl.json). Les ensembles de règles peuvent être attachés à des tâches ETL Glue ou exécutés indépendamment via les API StartDataQualityRuleRecommendationRun / StartDataQualityRulesetEvaluationRun pour évaluer des jeux de données stockés dans S3, des tables du catalogue ou des Glue DynamicFrames.

Détails de configuration clés et critères de décision :

Quand utiliser Glue Data Quality par rapport aux frameworks externes :

Patrons de validation des données dans les pipelines

La validation intervient à plusieurs points de contact : entrée (ingress), transformation et destination (sink). Patrons courants :

undefined

` ou incluez des paramètres de tâche pour déclencher les exécutions d’évaluation.

Comparaison des options de validation :

Pour le streaming, validez les enregistrements en transit et, en cas d’échec, poussez-les vers une DLQ SQS (configurez la RedrivePolicy avec maxReceiveCount via la CLI AWS ou la console) plutôt que de les supprimer. Pour le traitement par lots (batch), générez un artefact de rapport de validation et faites échouer ou mettez en quarantaine les sorties en fonction de la politique définie.

Détection d’anomalies et surveillance de la dérive des données

Utilisez la détection d’anomalies CloudWatch pour les métriques opérationnelles (enregistrements traités, taux d’erreur, durée de la tâche). Créez un détecteur avec la CLI : aws cloudwatch put-anomaly-detector --namespace "Glue" --metric-name "JobRunTime" --statistic "Average" --single-metric-anomaly-detector '{"MetricName":"JobRunTime","Namespace":"Glue","Stat":"Average","Dimensions":[...]}', puis créez des alarmes CloudWatch qui référencent la bande de détection d’anomalies. Pour la dérive au niveau des données (changements de distribution, variations du taux de valeurs nulles), planifiez des tâches de profilage (profile jobs) Glue DataBrew (aws databrew create-profile-job) pour calculer des statistiques, des histogrammes et des quantiles ; stockez les profils dans S3 comme lignes de base (baselines).

Critères de décision pour les alarmes d’anomalie par rapport aux alarmes à seuil :

Pour la détection automatisée de la dérive :

Gestion des SLA et fiabilité des pipelines

La gestion des SLA associe l’observabilité à la remédiation et à l’ingénierie de la fiabilité. Instrumentez chaque pipeline avec ces métriques de base : débit (enregistrements/sec), latence (ingestion→destination), taux d’erreur, durée du job/d’exécution et décomptes en aval. Utilisez CloudWatch Metrics pour les jobs Glue (métriques d’exécution de job), le décalage des consommateurs Kinesis/Kafka et les métriques d’application personnalisées via PutMetricData.

Patrons de fiabilité et détails de configuration :

Critères de décision pour la nouvelle tentative (retry) vs l’échec rapide (fail-fast) :

Pièges courants et critères de décision

Problème pratique : Scénario d’utilisation

Streamline Retail est confronté à de fréquentes erreurs de reporting en aval après l’ETL nocturne : pics de schéma occasionnels, violations de règles silencieuses et commandes en double lors du retraitement des exécutions échouées.

  1. Implémentez des règles Glue Data Quality (DQDL) pour le schéma, les seuils de valeurs nulles et l’unicité sur order_id ; définissez l’action en cas d’échec sur FAIL pour le job et publiez les artefacts d’évaluation sur S3.
  2. Ajoutez Great Expectations dans une étape Glue Python Shell pour des vérifications métier complexes (cohérence des commandes entre les tables) ; stockez les attentes (expectations) dans S3 et exécutez des checkpoints dans le pipeline.
  3. Planifiez des jobs de profilage DataBrew pour capturer des lignes de base quotidiennes (cardinalité, taux de valeurs nulles, percentiles) et utilisez des comparaisons automatisées pour détecter la dérive.
  4. Pour les événements de commande en streaming, configurez une DLQ SQS avec une RedrivePolicy appropriée et créez un job de relecture pour traiter les messages de la DLQ de manière idempotente (en utilisant order_id comme clé de déduplication).
  5. Instrumentez les détecteurs d’anomalies CloudWatch pour la durée d’exécution du job et le nombre d’erreurs ; attachez des alarmes basées sur les anomalies à SNS pour l’escalade à l’équipe d’astreinte.

Justification de la bonne pratique AWS : combinez les contrôles de qualité natifs de Glue pour une intégration rapide, Great Expectations pour l’expressivité, DataBrew pour les statistiques de référence et les détecteurs d’anomalies CloudWatch pour une surveillance adaptative. Les DLQ et les destinations (sinks) idempotentes bouclent la boucle pour des nouvelles tentatives et un retraitement sécurisés tout en préservant les SLA.


Optimisation des coûts pour les charges de travail de données · Tous les domaines

Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Réussissez votre examen →

Parcourir Amazon →

Related guides

Accès tout-en-un

Un seul abonnement. Chaque examen.

Chaque plan débloque la recherche de réponses illimitée, les tests pratiques, les explications IA et la bibliothèque complète de ressources — en plus de 20 langues.

Mensuel
24.87
Just €0.83/day
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

Meilleur rapport qualité/prix
12 mois
179.87
Just €0.49/daySave 40%
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

✓ Plan gratuit inclus · ✓ Annulez à tout moment · ✓ Tous les plans débloquent le produit complet