Google PDE: Orkiestracja przepływów pracy i automatyzacja potoków — Przewodnik do nauki

Część Google Professional Data Engineer — Przewodnik do nauki. Ćwicz ze zweryfikowanymi odpowiedziami w centrum egzaminów Google, albo rozwiąż testy na czas na ExamRoll.io.

Przegląd

Orkiestracja przepływów pracy i automatyzacja potoków koordynują zadania przetwarzania danych między usługami, tak aby pozyskiwanie, transformacja, kontrole jakości i publikowanie odbywały się w sposób niezawodny, bezpieczny i opłacalny. W Google Cloud orkiestracja musi być zgodna z modelem wykonania każdego obciążenia: zaplanowane zadania wsadowe (batch), strumienie sterowane zdarzeniami, zadania ad-hoc lub zadania długotrwałe. Cele projektowe to powtarzalność, idempotentność, obserwowalność, zasada najmniejszych uprawnień i bezpieczne promowanie między środowiskami.

Kluczowe wybory:

Model operacyjny kładzie nacisk na ponowienia prób z ograniczonym wykładniczym czasem oczekiwania (exponential backoff), limity czasu (timeouts), umowy SLA, nadrabianie zaległości (catchup) i uzupełnianie danych (backfills), projektowanie zadań w sposób idempotentny dla bezpiecznego ponownego uruchamiania oraz solidną obsługę błędów z przechwytywaniem w kolejce niedoręczonych wiadomości (dead-letter). Bezpieczeństwo jest egzekwowane poprzez konta serwisowe dedykowane dla każdego potoku, izolację sekretów, parametryzację i zasadę najmniejszych uprawnień w IAM. CI/CD, infrastruktura jako kod i kompleksowa telemetria dopełniają podejście gotowe do wdrożenia produkcyjnego.

Orkiestracja w Google Cloud: Narzędzia i Wzorce

Cloud Composer (Airflow)

undefined

undefined

undefined

undefined

undefined

undefined

undefined

undefined

Cloud Workflows, Cloud Scheduler, zadania Cloud Run i wykonanie sterowane zdarzeniami

Dataform: przepływy pracy SQL dla BigQuery

undefined

undefined

Dataproc, Dataflow i wzorce przechowywania danych

Niezawodność, obsługa błędów i idempotencja

Ponowienia, limity czasu i wycofywanie wykładnicze (backoff)

Uzupełnianie danych historycznych (backfill), nadrabianie (catchup) i obsługa błędów

Projektowanie zadań idempotentnych i ponowne uruchomienia

Rozwiązywanie problemów i skalowalność

Bezpieczeństwo, parametryzacja, środowiska i CI/CD

Parametryzacja i zarządzanie konfiguracją

Sekrety, konta usług i zasada najmniejszych uprawnień

CI/CD i infrastruktura jako kod

Obserwowalność, alerty i runbooki

Telemetria i alerty

Projektowanie runbooków

Praktyczny scenariusz problemu

Firma Acme Retail Analytics musi codziennie pozyskiwać pliki CSV od partnerów, które czasami zawierają nieprawidłowo sformatowane wiersze, transformować i ładować prawidłowe dane do BigQuery oraz udostępniać błędne wiersze do analizy. Chce również wprowadzić wzbogacanie sterowane zdarzeniami w celu aktualizacji cen w czasie zbliżonym do rzeczywistego oraz zapewnić bezpieczne promowanie zmian ze środowiska deweloperskiego (dev) na produkcyjne (prod).

Podejście:

  1. Przechowywanie i wyzwalacze zdarzeń

    • Utwórz dedykowany bucket Cloud Storage z włączonym wersjonowaniem obiektów i jednolitym dostępem na poziomie bucketa. Włącz powiadomienia o finalizacji obiektu (object finalize) do Pub/Sub za pośrednictwem Eventarc.
    • Uzasadnienie: Finalizacja obiektu jest niezawodnym zdarzeniem do wyzwalania dalszego pozyskiwania danych; wersjonowanie wspiera ponowne uruchomienia i audyty.
  2. Przetwarzanie wsadowe z obsługą kolejki niedostarczonych wiadomości (dead-letter)

    • Użyj Cloud Composer, aby uruchamiać codzienny DAG Airflow o godzinie 02:00 z włączoną opcją catchup. DAG uruchamia zadanie wsadowe Dataflow, które parsuje pliki CSV, waliduje schemat i zapisuje prawidłowe rekordy do BigQuery, używając deterministycznych tabel przejściowych (staging), a następnie wykonuje operację MERGE do docelowych tabel partycjonowanych. Przekierowuj nieprawidłowo sformatowane/nieudane rekordy do tabeli dead-letter w BigQuery.
    • Uzasadnienie: Dataflow skaluje parsowanie/walidację; MERGE zapewnia idempotentność; przechwytywanie do kolejki dead-letter umożliwia inspekcję bez blokowania potoku, co jest zgodne z zalecanym wzorcem dla nieprawidłowo sformatowanych wierszy.
  3. Wzbogacanie sterowane zdarzeniami

    • Wdróż zadanie Cloud Run do wykonywania lekkiego wzbogacania dla przyrostowych aktualizacji cen. Wyzwalaj je za pomocą Cloud Workflows, które nasłuchują na wiadomości Pub/Sub z Eventarc, gdy w ciągu dnia pojawiają się małe pliki z aktualizacjami.
    • Uzasadnienie: Kontenery bezserwerowe z Workflows zapewniają orkiestrację o niskim opóźnieniu i niskich wymaganiach operacyjnych dla małych zdarzeń, pozostawiając ciężkie transformacje w trybie wsadowym.
  4. Mechanizmy niezawodności

    • Skonfiguruj ponowienia z wykładniczym czasem oczekiwania (exponential backoff) dla błędów przejściowych w zadaniach Dataflow i Cloud Run, ograniczając całkowity czas ponowień do SLA dla DAG-a. Ustaw limity czasu wykonania dla poszczególnych zadań (execution_timeouts) i wywołania zwrotne on_failure w Airflow; w Workflows ustaw max_doublings i max_retry_duration.
    • Uzasadnienie: Ograniczony backoff chroni umowy SLA i zapobiega niekontrolowanym ponowieniom.
  5. Bezpieczeństwo i zasada najmniejszych uprawnień

    • Uruchamiaj każdy komponent z dedykowanym kontem serwisowym (SA): SA orkiestratora Composer, SA workera Dataflow, SA zadania Cloud Run. Nadawaj tylko wymagane role: odczyt GCS w buckecie z danymi wejściowymi dla Dataflow, dataEditor w BigQuery dla docelowych zbiorów danych oraz Viewer dla logów. Przechowuj sekrety w Secret Manager i odwołuj się do nich w czasie działania.
    • Uzasadnienie: Wymusza zasadę najmniejszych uprawnień i izoluje promień rażenia (blast radius).
  6. Orkiestracja sterowana metadanymi

    • Utrzymuj tabelę kontrolną w BigQuery, zawierającą listę źródeł partnerskich, wzorce plików i docelowe zbiory danych. W czasie działania DAG-a, Airflow odpytuje tę tabelę i używa dynamicznego mapowania zadań (dynamic task mapping) do tworzenia zadań dla każdego partnera.
    • Uzasadnienie: Dodanie partnera staje się zmianą danych, a nie zmianą w kodzie, co zmniejsza ryzyko wdrożenia.
  7. Obserwowalność i alerty

    • Emituj ustrukturyzowane logi z run_id i partner_id. Utwórz polityki alertów dla naruszeń SLA DAG-a, opóźnień systemowych Dataflow i niezerowej liczby wiadomości w kolejce dead-letter. Dla operacji wstawiania do tabeli docelowej w BigQuery, skonfiguruj ujście (sink) Cloud Logging z zaawansowanym filtrem dla tej tabeli do tematu Pub/Sub, który jest konsumowany przez narzędzie monitorujące Acme.
    • Uzasadnienie: Szczegółowe alerty umożliwiają szybką klasyfikację problemów (triage) bez zbędnego szumu.
  8. CI/CD i promowanie zmian

    • Zarządzaj infrastrukturą (buckety, Pub/Sub, Eventarc, Composer, Workflows, zbiory danych BigQuery) w Terraform. Użyj Cloud Build do walidacji składni DAG-ów Airflow, uruchamiania testów jednostkowych i wdrażania na środowisko deweloperskie Composer. Promuj na środowisko testowe i produkcyjne za pomocą sparametryzowanych konfiguracji i ręcznych bramek zatwierdzających, po pomyślnym przejściu asercji Dataform i testów integracyjnych.
    • Uzasadnienie: Deklaratywne, powtarzalne wdrożenia i bezpieczne promowanie zmian między środowiskami.
  9. Runbook i odzyskiwanie po awarii

    • Udokumentuj kroki w celu ponownego przetworzenia danych z określonej daty: przywróć plik CSV z wersjonowania obiektów, ponownie uruchom zadanie Dataflow dla tej partycji, scal (MERGE) wyniki i przejrzyj rekordy z DLQ. Uwzględnij procedurę „odtwarzania na stałym zbiorze danych” (fixed dataset replay), aby izolować błędy transformacji, jeśli pojawią się rozbieżności.
    • Uzasadnienie: Idempotentny projekt i udokumentowane procedury odzyskiwania usprawniają naprawę częściowych awarii.

Pozyskiwanie · Wszystkie domeny · Uczenie maszynowe

Przećwicz te pytania → · Testy na czas na ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Zdaj egzamin →

Przeglądaj Google →

Related guides

Dostęp all-in-one

Jedna subskrypcja. Każdy egzamin.

Każdy plan odblokowuje nieograniczone wyszukiwanie odpowiedzi, testy praktyczne, wyjaśnienia AI i pełną bibliotekę zasobów — w ponad 20 językach.

Miesięczny
24.87
Just €0.83/day
Wszystko w cenie:
  • Nieograniczone wyszukiwanie odpowiedzi
  • Nieograniczone testy praktyczne
  • Wyjaśnienia wspomagane AI
  • Pełna biblioteka zasobów
  • Ponad 20 języków
  • Cotygodniowe aktualizacje treści
  • Nagrody i polecenia
  • Priorytetowe wsparcie
Rozpocznij bezpłatny okres próbny

Karta kredytowa nie jest wymagana*

Najlepsza wartość
12 miesięcy
179.87
Just €0.49/daySave 40%
Wszystko w cenie:
  • Nieograniczone wyszukiwanie odpowiedzi
  • Nieograniczone testy praktyczne
  • Wyjaśnienia wspomagane AI
  • Pełna biblioteka zasobów
  • Ponad 20 języków
  • Cotygodniowe aktualizacje treści
  • Nagrody i polecenia
  • Priorytetowe wsparcie
Rozpocznij bezpłatny okres próbny

Karta kredytowa nie jest wymagana*

✓ Plan darmowy w zestawie · ✓ Anuluj w dowolnym momencie · ✓ Wszystkie plany odblokowują pełny produkt