È necessaria una pipeline per copiare i dati delle transazioni di serie temporali in BigQuery per l'analisi. La dimensione iniziale del dataset è di 1,5 PB e cresce di 3 TB/giorno; migliaia di transazioni vengono aggiornate ogni ora con un nuovo stato. I dati sono fortemente strutturati e utilizzati per il ML. Per massimizzare le prestazioni e l'usabilità, quali due strategie si adottano?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Denormalizzare i dati il più possibile., Sviluppare una pipeline di dati in cui gli aggiornamenti di stato vengono aggiunti a BigQuery anziché aggiornati..
Perché questa è la risposta
Denormalizzare i dati in BigQuery massimizza le prestazioni di query e l'usabilità per l'analisi e il ML. BigQuery è una base di dati colonnare ottimizzata per query analitiche su grandi dataset, e la denormalizzazione riduce i join complessi, migliorando la velocità. Sviluppare una pipeline che aggiunge gli aggiornamenti di stato anziché aggiornare le righe esistenti è fondamentale perché BigQuery non è ottimizzato per aggiornamenti frequenti a livello di riga. Invece, l'aggiunta di nuove righe con lo stato aggiornato (append-only) è il pattern preferito, consentendo di gestire efficacemente il volume di dati e gli aggiornamenti orari. Preservare la struttura dei dati (normalizzazione) è controproducente per le prestazioni analitiche in BigQuery. Usare UPDATE frequentemente è inefficiente e costoso. Copiare snapshot giornalieri e usare tabelle esterne non è ottimale per dati che cambiano frequentemente e richiedono analisi quasi in tempo reale.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta