Google PDE: Orchestrazione dei Flussi di Lavoro e Automazione delle Pipeline — Guida allo studio

Fa parte della Google Professional Data Engineer — Guida allo studio. Esercitati con risposte verificate nel centro esami Google, oppure fai test cronometrati su ExamRoll.io.

Panoramica

L’orchestrazione dei workflow e l’automazione delle pipeline coordinano i task di dati tra i vari servizi in modo che l’ingestion, la trasformazione, i controlli di qualità e la pubblicazione avvengano in modo affidabile, sicuro ed economico. In Google Cloud, l’orchestrazione deve allinearsi con il modello di esecuzione di ogni carico di lavoro: batch pianificati, stream guidati dagli eventi, ad-hoc o job a lunga esecuzione. Gli obiettivi di progettazione sono la ripetibilità, l’idempotenza, l’osservabilità, il principio del privilegio minimo e la promozione sicura tra gli ambienti.

Scelte chiave:

Il modello operativo enfatizza i tentativi con backoff esponenziale limitato, i timeout, gli SLA, le procedure di catchup e backfill, la progettazione di task idempotenti per riesecuzioni sicure e una gestione robusta dei fallimenti con cattura in una dead-letter queue. La sicurezza è garantita tramite account di servizio per-pipeline, isolamento dei secret, parametrizzazione e IAM basato sul principio del privilegio minimo. CI/CD, infrastructure as code e una telemetria completa definiscono un approccio pronto per la produzione.

Orchestrazione su Google Cloud: Strumenti e Pattern

Cloud Composer (Airflow)

undefined

undefined

undefined

undefined

undefined

undefined

undefined

undefined

undefined

Cloud Workflows, Cloud Scheduler, job di Cloud Run ed esecuzione guidata dagli eventi

Dataform: workflow SQL per BigQuery

undefined

undefined

undefined

Pattern per Dataproc, Dataflow e storage

Affidabilità, gestione dei guasti e idempotenza

Tentativi, timeout e backoff

Backfill, catchup e gestione dei guasti

Progettazione di task idempotenti e riesecuzioni

Risoluzione dei problemi e scalabilità

Sicurezza, parametrizzazione, ambienti e CI/CD

Parametrizzazione e gestione della configurazione

Segreti, service account e principio del privilegio minimo

CI/CD e infrastruttura come codice (IaC)

Osservabilità, Alerting e Runbook

Telemetria e alerting

Progettazione dei runbook

Scenario di un Problema Pratico

Acme Retail Analytics ha la necessità di ingerire quotidianamente file CSV forniti da partner, che occasionalmente contengono righe malformate. Deve trasformare e caricare i dati validi in BigQuery e far emergere le righe errate per l’analisi. Vuole anche un arricchimento event-driven per aggiornamenti dei prezzi quasi in tempo reale e una promozione sicura dall’ambiente di sviluppo (dev) a quello di produzione (prod).

Approccio:

  1. Storage e trigger basati su eventi

    • Creare un bucket Cloud Storage dedicato con versioning degli oggetti e accesso uniforme a livello di bucket. Abilitare le notifiche di finalizzazione dell’oggetto verso Pub/Sub tramite Eventarc.
    • Motivazione: La finalizzazione di un oggetto è un evento affidabile per avviare l’ingestion a valle; il versioning supporta le riesecuzioni e gli audit.
  2. Ingestion batch con gestione dei messaggi non recapitabili (dead-letter)

    • Usare Cloud Composer per pianificare un DAG Airflow giornaliero alle 02:00 con catchup abilitato. Il DAG avvia un job batch di Dataflow che effettua il parsing dei CSV, valida lo schema e scrive i record validi in BigQuery usando tabelle di staging deterministiche, per poi eseguire un’operazione di MERGE nelle tabelle di destinazione partizionate. Indirizzare i record malformati/falliti a una tabella dead-letter in BigQuery.
    • Motivazione: Dataflow scala il parsing/validazione; l’operazione MERGE garantisce l’idempotenza; l’acquisizione in una tabella dead-letter supporta l’ispezione senza bloccare la pipeline, in linea con il pattern raccomandato per le righe malformate.
  3. Arricchimento event-driven

    • Eseguire il deploy di un job Cloud Run per effettuare un arricchimento leggero (lightweight) per gli aggiornamenti incrementali dei prezzi. Attivarlo tramite Cloud Workflows in ascolto dei messaggi Pub/Sub da Eventarc quando arrivano piccoli file di aggiornamento durante il giorno.
    • Motivazione: I container serverless con Workflows forniscono un’orchestrazione a bassa latenza e con basso carico operativo (low-ops) per piccoli eventi, mantenendo le trasformazioni pesanti in modalità batch.
  4. Controlli di affidabilità

    • Configurare retry con backoff esponenziale per i fallimenti transitori nei job Dataflow e Cloud Run, limitando il tempo totale di retry in base allo SLA del DAG. Impostare timeout di esecuzione per singolo task e callback on_failure in Airflow; in Workflows, impostare max_doublings e max_retry_duration.
    • Motivazione: Il backoff limitato preserva gli SLA e previene retry incontrollati.
  5. Sicurezza e principio del privilegio minimo (least privilege)

    • Eseguire ogni componente con un service account dedicato: SA dell’orchestratore Composer, SA del worker Dataflow, SA del job Cloud Run. Concedere solo i ruoli necessari: GCS read sul bucket di ingest a Dataflow, BigQuery dataEditor sui dataset di destinazione e Viewer sui log. Archiviare i secret in Secret Manager e farvi riferimento a runtime.
    • Motivazione: Applica il principio del privilegio minimo e isola il raggio d’impatto (blast radius).
  6. Orchestrazione guidata da metadati

    • Mantenere una tabella di controllo in BigQuery che elenchi le fonti dei partner, i pattern dei file e i dataset di destinazione. A runtime del DAG, Airflow interroga questa tabella e utilizza la mappatura dinamica dei task per generare task specifici per partner.
    • Motivazione: L’aggiunta di un partner diventa una modifica ai dati, non una modifica al codice, riducendo il rischio di deployment.
  7. Osservabilità e alerting

    • Emettere log strutturati con run_id e partner_id. Creare policy di alerting per le violazioni degli SLA dei DAG, il system lag di Dataflow e i conteggi non nulli nella tabella dead-letter. Per gli inserimenti in BigQuery nella tabella di destinazione, configurare un sink di Cloud Logging con un filtro avanzato per quella tabella verso un topic Pub/Sub utilizzato dallo strumento di monitoraggio di Acme.
    • Motivazione: Alert granulari consentono un triage rapido e senza rumore di fondo.
  8. CI/CD e promozione

    • Gestire l’infrastruttura (bucket, Pub/Sub, Eventarc, Composer, Workflows, dataset BigQuery) con Terraform. Usare Cloud Build per validare la sintassi dei DAG di Airflow, eseguire gli unit test ed effettuare il deploy in un ambiente Composer di sviluppo. Promuovere agli ambienti di test e produzione con configurazioni parametrizzate e gate di approvazione manuale dopo il superamento delle asserzioni di Dataform e dei test di integrazione.
    • Motivazione: Deployment dichiarativi e ripetibili e promozione sicura tra gli ambienti.
  9. Runbook e ripristino

    • Documentare i passaggi per rieseguire (replay) i dati di una data specifica: ripristinare il CSV dal versioning degli oggetti, rieseguire il job Dataflow per quella partizione, eseguire il MERGE dei risultati e rivedere i record della DLQ. Includere una procedura di “replay di un dataset fisso” per isolare i bug di trasformazione in caso di discrepanze.
    • Motivazione: Un design idempotente e un ripristino documentato semplificano la remediation di fallimenti parziali.

Ingestione · Tutti i domini · Machine Learning

Esercitati su queste domande → · Pratica cronometrata su ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Supera l'esame →

Sfoglia Google →

Related guides

Accesso tutto incluso

Un abbonamento. Ogni esame.

Ogni piano sblocca la ricerca illimitata di risposte, test pratici, spiegazioni AI e la libreria completa di risorse — in oltre 20 lingue.

Mensile
24.87
Just €0.83/day
Tutto incluso:
  • Ricerca risposte illimitata
  • Test pratici illimitati
  • Spiegazioni basate su AI
  • Libreria completa di risorse
  • Oltre 20 lingue
  • Aggiornamenti settimanali dei contenuti
  • Premi e referral
  • Supporto prioritario
Inizia la prova gratuita

Nessuna carta di credito richiesta*

Miglior valore
12 mesi
179.87
Just €0.49/daySave 40%
Tutto incluso:
  • Ricerca risposte illimitata
  • Test pratici illimitati
  • Spiegazioni basate su AI
  • Libreria completa di risorse
  • Oltre 20 lingue
  • Aggiornamenti settimanali dei contenuti
  • Premi e referral
  • Supporto prioritario
Inizia la prova gratuita

Nessuna carta di credito richiesta*

✓ Piano gratuito incluso · ✓ Annulla in qualsiasi momento · ✓ Tutti i piani sbloccano il prodotto completo