Google PDE: Workflow-Orchestrierung und Pipeline-Automatisierung — Lernleitfaden

Teil des Google Professional Data Engineer — Lernleitfaden. Üben Sie mit verifizierten Antworten im Google-Prüfungscenter, oder absolvieren Sie zeitlich begrenzte Übungstests auf ExamRoll.io.

Überblick

Workflow-Orchestrierung und Pipeline-Automatisierung koordinieren Datenaufgaben über verschiedene Dienste hinweg, sodass die Erfassung, Transformation, Qualitätsprüfung und Veröffentlichung zuverlässig, sicher und kosteneffizient erfolgen. In Google Cloud muss die Orchestrierung auf das Ausführungsmodell jeder Workload abgestimmt sein: geplante Batch-Jobs, ereignisgesteuerte Streaming-Jobs, Ad-hoc-Jobs oder langlebige Jobs. Die Designziele sind Wiederholbarkeit, Idempotenz, Beobachtbarkeit (Observability), das Prinzip der geringsten Rechte (Least Privilege) und die sichere Beförderung (Promotion) durch Umgebungen.

Wichtige Auswahlmöglichkeiten:

Das Betriebsmodell legt den Schwerpunkt auf Wiederholungsversuche mit begrenztem exponentiellem Backoff, Timeouts, SLAs, Catchup und Backfills, idempotentes Task-Design für sichere Wiederholungen und eine robuste Fehlerbehandlung mit Erfassung in einer Dead-Letter-Queue. Die Sicherheit wird durch Servicekonten pro Pipeline, Isolierung von Secrets, Parametrisierung und IAM mit geringsten Rechten durchgesetzt. CI/CD, Infrastructure as Code und umfassende Telemetrie vervollständigen einen produktionsreifen Ansatz.

Orchestrierung in Google Cloud: Werkzeuge und Muster

Cloud Composer (Airflow)

undefined

undefined

undefined

undefined

undefined

undefined

undefined

undefined

undefined

Cloud Workflows, Cloud Scheduler, Cloud Run-Jobs und ereignisgesteuerte Ausführung

Dataform: SQL-Workflows für BigQuery

Dataproc, Dataflow und Speichermuster

Zuverlässigkeit, Fehlerbehandlung und Idempotenz

Wiederholungsversuche, Timeouts und Backoff

Backfills, Catchup und Fehlerbehandlung

Idempotentes Aufgabendesign und Wiederholungen

Fehlerbehebung und Skalierbarkeit

Sicherheit, Parametrisierung, Umgebungen und CI/CD

Parametrisierung und Konfigurationsmanagement

Secrets, Service Accounts und Least Privilege (Prinzip der geringsten Rechte)

CI/CD und Infrastructure as Code

Observability, Benachrichtigungen und Runbooks

Telemetrie und Benachrichtigungen

Runbook-Design

Praktisches Problemszenario

Acme Retail Analytics muss tägliche CSV-Lieferungen von Partnern verarbeiten, die gelegentlich fehlerhafte Zeilen enthalten, die validen Daten transformieren und in BigQuery laden und die fehlerhaften Zeilen zur Untersuchung aufzeigen. Zudem wünschen sie eine ereignisgesteuerte Anreicherung für Preisaktualisierungen in Nahezu-Echtzeit und eine sichere Überführung von der Entwicklungs- in die Produktionsumgebung.

Vorgehensweise:

  1. Speicher und Ereignis-Trigger

    • Erstellen Sie einen dedizierten Cloud Storage-Bucket mit Objektversionierung und einheitlichem Zugriff auf Bucket-Ebene. Aktivieren Sie Benachrichtigungen über den Abschluss von Objekten (object finalize) an Pub/Sub über Eventarc.
    • Begründung: Der Abschluss eines Objekts ist ein zuverlässiges Ereignis, um die nachgelagerte Verarbeitung auszulösen; die Versionierung unterstützt Wiederholungen und Audits.
  2. Batch-Verarbeitung mit Dead-Letter-Handling

    • Verwenden Sie Cloud Composer, um täglich um 02:00 Uhr einen Airflow-DAG mit aktiviertem Catchup zu planen. Der DAG startet einen Dataflow-Batch-Job, der CSVs parst, das Schema validiert und valide Datensätze in BigQuery schreibt, indem er deterministische Staging-Tabellen verwendet und dann mittels MERGE in partitionierte Zieltabellen zusammenführt. Leiten Sie fehlerhafte/fehlgeschlagene Datensätze in eine BigQuery Dead-Letter-Tabelle weiter.
    • Begründung: Dataflow skaliert das Parsen/Validieren; MERGE stellt Idempotenz sicher; die Erfassung in einer Dead-Letter-Tabelle ermöglicht die Untersuchung, ohne die Pipeline zu blockieren, was dem empfohlenen Muster für fehlerhafte Zeilen entspricht.
  3. Ereignisgesteuerte Anreicherung

    • Stellen Sie einen Cloud Run-Job bereit, der eine leichtgewichtige Anreicherung für inkrementelle Preisaktualisierungen durchführt. Lösen Sie ihn über Cloud Workflows aus, die auf Pub/Sub-Nachrichten von Eventarc lauschen, wenn tagsüber kleine Aktualisierungsdateien eintreffen.
    • Begründung: Serverless-Container mit Workflows bieten eine latenzarme Orchestrierung mit geringem Betriebsaufwand für kleine Ereignisse, während aufwendige Transformationen im Batch-Modus verbleiben.
  4. Zuverlässigkeitskontrollen

    • Konfigurieren Sie Wiederholungsversuche mit exponentiellem Backoff für transiente Fehler in Dataflow- und Cloud Run-Jobs und begrenzen Sie die gesamte Wiederholungszeit auf das DAG-SLA. Legen Sie in Airflow Ausführungs-Timeouts pro Task und on_failure-Callbacks fest; in Workflows setzen Sie max_doublings und max_retry_duration.
    • Begründung: Begrenzter Backoff schont SLAs und verhindert ausufernde Wiederholungsversuche.
  5. Sicherheit und Prinzip der geringsten Rechte

    • Führen Sie jede Komponente unter einem dedizierten Servicekonto aus: Composer Orchestrator SA, Dataflow Worker SA, Cloud Run Job SA. Vergeben Sie nur die erforderlichen Rollen: GCS-Lesezugriff auf den Ingest-Bucket für Dataflow, BigQuery dataEditor für die Zieldatensätze und Viewer für die Logs. Speichern Sie Secrets im Secret Manager und referenzieren Sie sie zur Laufzeit.
    • Begründung: Setzt das Prinzip der geringsten Rechte durch und isoliert den „Blast Radius“ (Schadensradius).
  6. Metadatengesteuerte Orchestrierung

    • Führen Sie eine BigQuery-Kontrolltabelle, die Partnerquellen, Dateimuster und Zieldatensätze auflistet. Zur Laufzeit des DAGs fragt Airflow diese Tabelle ab und verwendet dynamisches Task-Mapping, um für jeden Partner eigene Tasks zu erzeugen.
    • Begründung: Das Hinzufügen eines Partners wird zu einer Datenänderung, nicht zu einer Code-Änderung, was das Bereitstellungsrisiko verringert.
  7. Observability und Benachrichtigungen

    • Geben Sie strukturierte Logs mit run_id und partner_id aus. Erstellen Sie Benachrichtigungsrichtlinien für SLA-Verletzungen von DAGs, Dataflow-Systemverzögerungen und nicht leere Dead-Letter-Zähler. Konfigurieren Sie für BigQuery-Inserts in die Zieltabelle eine Cloud Logging-Senke mit einem erweiterten Filter für diese Tabelle, die an ein Pub/Sub-Topic sendet, das vom Überwachungstool von Acme konsumiert wird.
    • Begründung: Feingranulare Benachrichtigungen ermöglichen eine schnelle Triage ohne Störsignale.
  8. CI/CD und Promotion

    • Verwalten Sie die Infrastruktur (Buckets, Pub/Sub, Eventarc, Composer, Workflows, BigQuery-Datasets) in Terraform. Verwenden Sie Cloud Build, um die Syntax von Airflow-DAGs zu validieren, Unit-Tests auszuführen und in einer dev-Composer-Umgebung bereitzustellen. Führen Sie die Promotion in die Test- und Prod-Umgebung mit parametrisierten Konfigurationen und manuellen Genehmigungs-Gates durch, nachdem Dataform-Assertions und Integrationstests erfolgreich waren.
    • Begründung: Deklarative, wiederholbare Deployments und sichere Promotion über Umgebungen hinweg.
  9. Runbook und Wiederherstellung

    • Dokumentieren Sie die Schritte zur Wiederholung eines bestimmten Datums: Wiederherstellen der CSV-Datei aus der Objektversionierung, erneutes Ausführen des Dataflow-Jobs für diese Partition, MERGE der Ergebnisse und Überprüfen der DLQ-Datensätze. Fügen Sie ein „Fixed-Dataset-Replay“-Verfahren hinzu, um Transformationsfehler zu isolieren, falls Diskrepanzen auftreten.
    • Begründung: Idempotentes Design und dokumentierte Wiederherstellung vereinfachen die Behebung von Teilfehlern.

Daten-Ingestion · Alle Domänen · Maschinelles Lernen

Diese Fragen üben → · Zeitlich begrenzte Übung auf ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Bestehe deine Prüfung →

Google durchsuchen →

Related guides

All-in-One Zugang

Ein Abonnement. Jede Prüfung.

Jeder Plan schaltet unbegrenzte Antwortsuche, Übungstests, KI-Erklärungen und die vollständige Ressourcenbibliothek frei – in über 20 Sprachen.

Monatlich
24.87
Just €0.83/day
Alles inklusive:
  • Unbegrenzte Antwortsuche
  • Unbegrenzte Übungstests
  • KI-gestützte Erklärungen
  • Vollständige Ressourcenbibliothek
  • Über 20 Sprachen
  • Wöchentliche Inhaltsaktualisierungen
  • Belohnungen & Empfehlungen
  • Priorisierter Support
Kostenlose Testphase starten

Keine Kreditkarte erforderlich*

Bestes Preis-Leistungs-Verhältnis
12 Monate
179.87
Just €0.49/daySave 40%
Alles inklusive:
  • Unbegrenzte Antwortsuche
  • Unbegrenzte Übungstests
  • KI-gestützte Erklärungen
  • Vollständige Ressourcenbibliothek
  • Über 20 Sprachen
  • Wöchentliche Inhaltsaktualisierungen
  • Belohnungen & Empfehlungen
  • Priorisierter Support
Kostenlose Testphase starten

Keine Kreditkarte erforderlich*

✓ Kostenloser Plan enthalten · ✓ Jederzeit kündbar · ✓ Alle Pläne schalten das vollständige Produkt frei