Amazon DEA-C01: Orchestration des données et gestion des flux de travail — Guide d'étude

Fait partie du Amazon Data Engineer Associate DEA-C01 — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Amazon, ou passez des tests chronométrés sur ExamRoll.io.

L’orchestration et la gestion de flux de travail sont au cœur de la construction de plateformes de données fiables et maintenables : elles coordonnent les tâches d’extraction, de transformation et de chargement (ETL), gèrent les dépendances, traitent les échecs et intègrent les processus événementiels. Ce domaine couvre les options AWS gérées pour l’ETL par lots, les DAGs complexes, les machines à états serverless et la planification d’événements — chacune avec des sémantiques d’exécution, une durabilité et des compromis de mise à l’échelle différents. Comprendre quand utiliser AWS Glue Workflows, MWAA, Step Functions ou EventBridge Scheduler — et comment configurer la gestion des erreurs et l’observabilité — est essentiel pour obtenir des pipelines prévisibles et maîtriser les coûts opérationnels.

AWS Glue Workflows et déclencheurs (triggers)

AWS Glue Workflows regroupe des tâches Glue, des crawlers et des déclencheurs dans un graphe de dépendances et vous permet d’exécuter des ETL coordonnés. Créez des flux de travail via la console ou la CLI (aws glue create-workflow –name MonWorkflow). Les déclencheurs s’attachent aux flux de travail et sont de trois types : planifiés, à la demande et conditionnels. Exemple de création par CLI pour un déclencheur planifié :

Les déclencheurs conditionnels utilisent un Prédicat (Predicate) qui référence le nom et l’état d’une tâche (SUCCEEDED, FAILED). Exemple de JSON pour un prédicat : {“Logical”:“AND”,“Conditions”:[{“JobName”:“prev-job”,“State”:“SUCCEEDED”}]}. Par défaut, les déclencheurs conditionnels de Glue se déclenchent en cas de succès ; pour gérer les échecs, configurez des conditions avec State=FAILED ou créez un déclencheur FAILED explicite pour router les erreurs vers des tâches de remédiation ou des alertes SNS.

Modèles opérationnels et critères de décision :

Gestion des erreurs : ajoutez des déclencheurs FAILED, émettez des métriques CloudWatch sur le succès/échec des tâches, et envoyez les échecs vers une file d’attente de lettres mortes (dead-letter queue) SQS/SNS via Lambda pour des tentatives de réessai automatisées et des investigations.

Amazon MWAA (Managed Airflow) pour les DAGs complexes

MWAA fournit un environnement Apache Airflow géré pour exprimer des DAGs complexes, des dépendances entre tâches, des capteurs (sensors) et des opérateurs personnalisés. Créez des environnements avec aws mwaa create-environment –name MyEnv –airflow-configuration-options Key=core.executor,Value=CeleryExecutor et fournissez un chemin S3 pour les DAGs ainsi qu’un rôle d’exécution. Détails importants sur le dimensionnement et le réseau :

Critères de décision :

Gestion des erreurs dans Airflow : utilisez les tentatives de réessai (retries) et retry_delay dans les définitions de DAG, définissez on_failure_callback pour notifier ou envoyer vers une file d’attente de lettres mortes SQS, et configurez la gestion des SLA au niveau de la tâche pour déclencher des DAGs de remédiation.

AWS Step Functions pour l’orchestration serverless

Step Functions fournit une orchestration avec état (stateful) avec un langage basé sur JSON, l’Amazon States Language, et s’intègre largement avec les services AWS. Choisissez entre les flux de travail Standard et Express :

Cas d’utilisation et critères de décision :

Gestion des erreurs et modèles d’intégration :

EventBridge Scheduler et pipelines pilotés par les événements

EventBridge fournit un routage d’événements riche et une fonctionnalité Scheduler pour les tâches cron et ponctuelles. Créez des règles basées sur une planification avec

undefined

et attachez des cibles via

undefined

. Pour le routage piloté par les événements (basé sur des motifs), utilisez

undefined

avec

undefined

pour router les événements S3 vers Lambda, Step Functions ou SQS.

Points opérationnels clés :

undefined

accepte un

undefined

avec l'

undefined

d’une file d’attente SQS.

Gestion des erreurs : configurez des tentatives de relance et un backoff spécifiques à la cible, utilisez une DLQ pour les livraisons échouées, et combinez EventBridge avec Step Functions pour une gestion d’erreurs complexe et des transactions de compensation.

Pièges courants et critères de décision

Problème pratique : ETL horaire d’Acme Retail avec des pics d’activité

Acme Retail a besoin d’un ETL horaire qui exécute des tâches Glue pour l’ingestion brute, un DAG d’enrichissement complexe avec des opérateurs Python, et une agrégation de SKU à courte durée de vie qui doit répondre à des événements d’inventaire à haute fréquence. Ils exigent des nouvelles tentatives robustes et une capture des échecs.

  1. Utilisez EventBridge pour déclencher une règle planifiée horaire qui invoque un flux de travail Step Functions Standard pour coordonner le pipeline global.
  2. Dans Step Functions, orchestrez les tâches Glue de longue durée (

undefined

) avec des gestionnaires Retry et Catch ; en cas d’échec, routez vers une DLQ SQS et une Lambda de remédiation via un bloc Catch. 3. Déployez les DAG d’enrichissement complexes dans MWAA et invoquez-les depuis Step Functions en utilisant l’API REST d’Airflow ou en plaçant des messages d’exécution de DAG sur SQS ; dimensionnez les workers MWAA via les paramètres

undefined

en fonction de la concurrence attendue et surveillez les métriques CloudWatch pour ajuster. 4. Pour les événements d’inventaire à haute fréquence, utilisez des règles EventBridge basées sur des motifs d’événements (event-pattern) pour pousser vers un Express Step Function ou une Lambda avec des clés d’idempotence et une DLQ basée sur SQS pour absorber les pics. 5. Implémentez une surveillance centralisée (CloudWatch Logs/Metrics, X-Ray pour Step Functions), et définissez des alertes sur la croissance de la DLQ et l’épuisement des nouvelles tentatives de tâches.

Justification : Cette conception utilise le bon outil pour chaque besoin — Step Functions pour l’orchestration inter-services durable et la gestion des erreurs, MWAA pour la logique de DAG complexe, Glue pour l’ETL géré, et EventBridge pour la planification et les événements réactifs. Elle impose l’idempotence et les DLQ pour des pipelines résilients et observables, conformes aux meilleures pratiques AWS.


Transformation et traitement des données · Tous les domaines · Requêtage et analyse des données

Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Réussissez votre examen →

Parcourir Amazon →

Related guides

Accès tout-en-un

Un seul abonnement. Chaque examen.

Chaque plan débloque la recherche de réponses illimitée, les tests pratiques, les explications IA et la bibliothèque complète de ressources — en plus de 20 langues.

Mensuel
24.87
Just €0.83/day
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

Meilleur rapport qualité/prix
12 mois
179.87
Just €0.49/daySave 40%
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

✓ Plan gratuit inclus · ✓ Annulez à tout moment · ✓ Tous les plans débloquent le produit complet