Amazon DEA-C01: Datenorchestrierung und Workflow-Management — Lernleitfaden

Teil des Amazon Data Engineer Associate DEA-C01 — Lernleitfaden. Üben Sie mit verifizierten Antworten im Amazon-Prüfungscenter, oder absolvieren Sie zeitlich begrenzte Übungstests auf ExamRoll.io.

Orchestrierung und Workflow-Management sind zentral für den Aufbau zuverlässiger, wartbarer Datenplattformen: Sie koordinieren Extract-Transform-Load-Jobs, verwalten Abhängigkeiten, behandeln Fehler und integrieren ereignisgesteuerte Prozesse. Dieser Bereich behandelt verwaltete AWS-Optionen für Batch-ETL, komplexe DAGs, serverlose Zustandsautomaten und die Ereignisplanung – jeweils mit unterschiedlicher Ausführungssemantik, Dauerhaftigkeit und Kompromissen bei der Skalierung. Zu verstehen, wann man AWS Glue Workflows, MWAA, Step Functions oder EventBridge Scheduler einsetzt – und wie man Fehlerbehandlung und Observability konfiguriert – ist entscheidend für vorhersagbare Pipelines und die Kontrolle der Betriebskosten.

AWS Glue Workflows und Trigger

AWS Glue Workflows gruppieren Glue-Jobs, Crawler und Trigger in einem Abhängigkeitsgraphen und ermöglichen die Ausführung koordinierter ETL-Prozesse. Workflows werden über die Konsole oder die CLI erstellt (

undefined

). Trigger werden an Workflows angehängt und es gibt sie in drei Arten: zeitgesteuert (scheduled), bei Bedarf (on-demand) und bedingt (conditional). Beispiel für die Erstellung eines zeitgesteuerten Triggers per CLI:

undefined

Bedingte Trigger verwenden ein Prädikat (Predicate), das sich auf den Jobnamen und den Status (SUCCEEDED, FAILED) bezieht. Beispiel für ein Prädikat in JSON:

undefined

. Standardmäßig werden bedingte Glue-Trigger bei Erfolg ausgelöst; um Fehler zu behandeln, konfigurieren Sie Bedingungen mit State=FAILED oder erstellen Sie einen expliziten FAILED-Trigger, um Fehler an Korrektur-Jobs oder SNS-Benachrichtigungen weiterzuleiten.

Betriebsmuster und Entscheidungskriterien:

undefined

oder

undefined

für On-Demand-Trigger.

Fehlerbehandlung: Fügen Sie FAILED-Trigger hinzu, senden Sie CloudWatch-Metriken für den Erfolg/Misserfolg von Jobs und leiten Sie Fehler über Lambda an eine SQS/SNS Dead-Letter-Queue weiter, um automatisierte Wiederholungsversuche und Untersuchungen zu ermöglichen.

Amazon MWAA (Managed Airflow) für komplexe DAGs

MWAA stellt eine verwaltete Apache Airflow-Umgebung bereit, um komplexe DAGs, Aufgabenabhängigkeiten, Sensoren und benutzerdefinierte Operatoren auszudrücken. Erstellen Sie Umgebungen mit

undefined

und geben Sie einen S3-Pfad für die DAGs sowie eine Ausführungsrolle an. Wichtige Details zur Dimensionierung und zum Netzwerk:

undefined

,

undefined

und den Scheduler an die Parallelität der Aufgaben und die Komplexität der DAGs an.

Entscheidungskriterien:

Fehlerbehandlung in Airflow: Verwenden Sie Aufgabenwiederholungen (task retries) und

undefined

in den DAG-Definitionen, setzen Sie

undefined

, um Benachrichtigungen zu senden oder Fehler an eine SQS Dead-Letter-Queue zu pushen, und konfigurieren Sie die SLA-Behandlung auf Task-Ebene, um Korrektur-DAGs auszulösen.

AWS Step Functions für serverlose Orchestrierung

Step Functions bieten eine zustandsbehaftete Orchestrierung mit der JSON-basierten Amazon States Language und lassen sich umfassend in AWS-Services integrieren. Wählen Sie zwischen Standard- und Express-Workflows:

undefined

.

Anwendungsfälle und Entscheidungskriterien:

Fehlerbehandlungs- und Integrationsmuster:

undefined

,

undefined

,

undefined

und

undefined

zu definieren.

undefined

mit Fehlerdetails für die Diagnose zu füllen.

undefined

und

undefined

für die Observability.

EventBridge Scheduler und ereignisgesteuerte Pipelines

EventBridge bietet umfassendes Event-Routing und eine Scheduler-Funktion für Cron- und einmalige Aufgaben. Erstellen Sie zeitplanbasierte Regeln mit aws events put-rule --name dailyRule --schedule-expression "cron(0 2 * * ? *)" und fügen Sie Ziele über aws events put-targets hinzu. Für ereignisgesteuertes (musterbasiertes) Routing verwenden Sie put-rule mit --event-pattern '{"source":["aws.s3"],"detail-type":["Object Created"]}', um S3-Ereignisse an Lambda, Step Functions oder SQS weiterzuleiten.

Wichtige operative Punkte:

Fehlerbehandlung: Konfigurieren Sie zielspezifische Wiederholungsversuche und Backoff, verwenden Sie eine DLQ für fehlgeschlagene Zustellungen und kombinieren Sie EventBridge mit Step Functions für komplexe Fehlerbehandlung und kompensierende Transaktionen.

Häufige Fallstricke und Entscheidungskriterien

Praktisches Problem: Stündlicher ETL bei Acme Retail mit Lastspitzen

Acme Retail benötigt einen stündlichen ETL-Prozess, der Glue-Jobs für die Rohdatenerfassung, einen komplexen Anreicherungs-DAG mit Python-Operatoren und eine kurzlebige SKU-Aggregation ausführt, die auf hochfrequente Bestandsereignisse reagieren muss. Sie fordern robuste Wiederholungsversuche und eine Fehlererfassung.

  1. Verwenden Sie EventBridge, um eine stündlich geplante Regel auszulösen, die einen Step Functions Standard Workflow aufruft, um die gesamte Pipeline zu koordinieren.
  2. Orchestrieren Sie in Step Functions langlaufende Glue-Jobs (StartJobRun) mit Retry- und Catch-Handlern; leiten Sie im Fehlerfall über einen Catch-Block an eine SQS-DLQ und eine Behebungs-Lambda weiter.
  3. Stellen Sie die komplexen Anreicherungs-DAGs in MWAA bereit und rufen Sie sie von Step Functions aus über die Airflow REST API oder durch Platzieren von DAG-Run-Nachrichten in SQS auf; dimensionieren Sie die MWAA-Worker über die celery.worker_autoscale-Einstellungen basierend auf der erwarteten Parallelität und überwachen Sie CloudWatch-Metriken zur Anpassung.
  4. Für hochfrequente Bestandsereignisse verwenden Sie EventBridge-Regeln mit Event-Pattern, um Ereignisse an eine Express Step Function oder eine Lambda mit Idempotenzschlüsseln und einer SQS-gestützten DLQ zu senden, um Lastspitzen abzufangen.
  5. Implementieren Sie zentralisiertes Monitoring (CloudWatch Logs/Metrics, X-Ray für Step Functions) und richten Sie Alarme für das Anwachsen der DLQ und die Erschöpfung von Task-Wiederholungsversuchen ein.

Begründung: Dieses Design verwendet für jede Anforderung das richtige Werkzeug – Step Functions für langlebige, dienstübergreifende Orchestrierung und Fehlerbehandlung, MWAA für komplexe DAG-Logik, Glue für verwalteten ETL und EventBridge für Zeitplanung und reaktive Ereignisse. Es erzwingt Idempotenz und DLQs für resiliente, beobachtbare Pipelines, die den Best Practices von AWS entsprechen.


Datentransformation und -verarbeitung · Alle Domänen · Datenabfrage und -analyse

Diese Fragen üben → · Zeitlich begrenzte Übung auf ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Bestehe deine Prüfung →

Amazon durchsuchen →

Related guides

All-in-One Zugang

Ein Abonnement. Jede Prüfung.

Jeder Plan schaltet unbegrenzte Antwortsuche, Übungstests, KI-Erklärungen und die vollständige Ressourcenbibliothek frei – in über 20 Sprachen.

Monatlich
24.87
Just €0.83/day
Alles inklusive:
  • Unbegrenzte Antwortsuche
  • Unbegrenzte Übungstests
  • KI-gestützte Erklärungen
  • Vollständige Ressourcenbibliothek
  • Über 20 Sprachen
  • Wöchentliche Inhaltsaktualisierungen
  • Belohnungen & Empfehlungen
  • Priorisierter Support
Kostenlose Testphase starten

Keine Kreditkarte erforderlich*

Bestes Preis-Leistungs-Verhältnis
12 Monate
179.87
Just €0.49/daySave 40%
Alles inklusive:
  • Unbegrenzte Antwortsuche
  • Unbegrenzte Übungstests
  • KI-gestützte Erklärungen
  • Vollständige Ressourcenbibliothek
  • Über 20 Sprachen
  • Wöchentliche Inhaltsaktualisierungen
  • Belohnungen & Empfehlungen
  • Priorisierter Support
Kostenlose Testphase starten

Keine Kreditkarte erforderlich*

✓ Kostenloser Plan enthalten · ✓ Jederzeit kündbar · ✓ Alle Pläne schalten das vollständige Produkt frei