Google PDE: Archiviazione dei Dati, Data Lake e Formati di File — Guida allo studio

Fa parte della Google Professional Data Engineer — Guida allo studio. Esercitati con risposte verificate nel centro esami Google, oppure fai test cronometrati su ExamRoll.io.

Formati dei file, compressione e comportamento delle query

La scelta del formato corretto ha un impatto di primo ordine su costi e prestazioni.

Layout, partizionamento, ingegneria delle prestazioni, residenza e migrazione

undefined

Scenario di un Problema Pratico

Acme Retail riceve quotidianamente invii di file CSV da un partner logistico in un bucket regionale di Cloud Storage. I file contengono occasionalmente righe malformate. Acme deve acquisire, validare, convertire in un formato pronto per l’analisi e caricare i dati in BigQuery per dashboard quasi in tempo reale, conservando le righe errate per ispezione e applicando la governance.

Approccio:

  1. Acquisire e governare i dati grezzi in Dataplex

    • Creare un lake Dataplex con un asset di una zona “raw” mappato su gs://acme-raw/logistics/.
    • Motivazione: Governance, metadati e lineage centralizzati. Applicare IAM a livello di zona e contrassegnare i campi sensibili con policy tag per l’applicazione a valle.
  2. Applicare ciclo di vita e conservazione

    • Applicare una policy di conservazione del bucket di 30 giorni e abilitare il versioning degli oggetti su acme-raw.
    • Motivazione: Protegge da sovrascritture/cancellazioni accidentali da parte del partner; una breve conservazione bilancia costi e recuperabilità. Il versioning facilita il rollback di consegne errate.
  3. Validare e ingerire con una pipeline batch di Dataflow

    • Attivare un job Dataflow giornaliero tramite notifiche di finalizzazione dell’oggetto. Leggere i CSV con uno schema e una validazione per singolo record; scrivere i record validi in una tabella di staging di BigQuery (partizionata per event_date) e instradare gli errori di parsing/validazione a una tabella BigQuery dead-letter.
    • Motivazione: Dataflow fornisce un parsing parallelo e scalabile e una gestione robusta dei messaggi non recapitabili (dead-letter), consentendo agli analisti di ispezionare le righe errate. Questo rispecchia le best practice per la gestione di CSV di qualità eterogenea.
  4. Compattare e convertire in Parquet nella zona curata

    • La stessa pipeline scrive i dati validati in gs://acme-curated/logistics/date=YYYY-MM-DD/ come file Parquet di dimensioni comprese tra ~256 e 512 MB.
    • Motivazione: Parquet abilita il column pruning e il predicate pushdown in BigQuery e Spark, riducendo i byte scansionati e migliorando la latenza; la compattazione mitiga l’overhead dei file di piccole dimensioni derivante dallo schema di consegna del partner.
  5. Esporre analisi governate tramite BigLake

    • Creare una tabella esterna BigLake sul percorso Parquet curato con partizionamento automatico in stile Hive; applicare policy tag a livello di colonna e policy di accesso a livello di riga per filtri specifici del partner.
    • Motivazione: Accesso granulare e uniforme tra BigQuery e Spark con audit centralizzato. Il partition pruning riduce i costi di scansione sui filtri per data.
  6. Caricare aggregati critici in tabelle BigQuery native

    • Per le dashboard ad accesso frequente (“hot”), eseguire un job BigQuery pianificato che ingerisca gli ultimi N giorni dalla tabella esterna Parquet curata in una tabella nativa partizionata e clusterizzata.
    • Motivazione: Lo storage nativo accelera la BI ad alta concorrenza, mentre la tabella esterna BigLake rimane il system-of-record governato per un accesso più ampio.
  7. Monitorare e allertare con Cloud Logging e Pub/Sub

    • Creare un sink di log che filtri gli esiti dei job di Dataflow e di caricamento di BigQuery verso Pub/Sub; integrare con lo strumento di monitoraggio per allarmi istantanei su fallimenti o tassi elevati di righe errate.
    • Motivazione: Visibilità operativa mirata e specifica per tabella senza polling; supporta le pratiche SRE.
  8. Ottimizzare classe di archiviazione e residenza

    • Mantenere il Parquet curato in classe Standard per 14 giorni, passare a Coldline dopo 30 giorni tramite una regola del ciclo di vita; archiviare sia i bucket raw che quelli curati nella stessa regione dei dataset BigQuery per evitare costi di egress.
    • Motivazione: Bilancia le prestazioni di lettura “hot” con i costi. La co-locazione mantiene la conformità e minimizza la latenza e i costi di egress.
  9. Validare la qualità end-to-end

    • Dopo ogni esecuzione, confrontare conteggi e aggregati hash tra le tabelle di staging, esterna curata e nativa di BigQuery; mettere in quarantena le anomalie.
    • Motivazione: Rilevamento precoce di schema drift o regressioni nell’ingestione; gli hash crittografici o di tipo fingerprint forniscono una garanzia leggera senza la necessità di riscansioni complete.

Questo design fornisce un’ingestione resiliente con analisi dei messaggi non recapitabili (dead-letter), dati in formato Parquet pronti per l’analisi per query efficienti, governance centralizzata tramite Dataplex e BigLake, e policy del ciclo di vita ottimizzate per i costi, il tutto aderendo al principio dell’accesso con privilegi minimi e a operazioni auditabili.


Architettura e Progettazione dell’Ingegneria dei Dati · Tutti i domini · Analisi con BigQuery e Ingegneria del Data Warehouse

Esercitati su queste domande → · Pratica cronometrata su ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Supera l'esame →

Sfoglia Google →

Related guides

Accesso tutto incluso

Un abbonamento. Ogni esame.

Ogni piano sblocca la ricerca illimitata di risposte, test pratici, spiegazioni AI e la libreria completa di risorse — in oltre 20 lingue.

Mensile
24.87
Just €0.83/day
Tutto incluso:
  • Ricerca risposte illimitata
  • Test pratici illimitati
  • Spiegazioni basate su AI
  • Libreria completa di risorse
  • Oltre 20 lingue
  • Aggiornamenti settimanali dei contenuti
  • Premi e referral
  • Supporto prioritario
Inizia la prova gratuita

Nessuna carta di credito richiesta*

Miglior valore
12 mesi
179.87
Just €0.49/daySave 40%
Tutto incluso:
  • Ricerca risposte illimitata
  • Test pratici illimitati
  • Spiegazioni basate su AI
  • Libreria completa di risorse
  • Oltre 20 lingue
  • Aggiornamenti settimanali dei contenuti
  • Premi e referral
  • Supporto prioritario
Inizia la prova gratuita

Nessuna carta di credito richiesta*

✓ Piano gratuito incluso · ✓ Annulla in qualsiasi momento · ✓ Tutti i piani sbloccano il prodotto completo