I file CSV in Cloud Storage contengono tipi di dati misti e formati incoerenti (numeri di telefono, indirizzi). Quale approccio di pipeline garantisce la qualità dei dati tramite la pulizia e la trasformazione prima del caricamento in BigQuery?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Utilizzare Data Fusion per trasformare i dati prima di caricarli in BigQuery..
Perché questa è la risposta
Data Fusion è la soluzione più adatta per la pulizia e la trasformazione di dati complessi e incoerenti prima del caricamento in BigQuery. Offre un'interfaccia visuale per costruire pipeline ETL/ELT, permettendo di gestire facilmente tipi di dati misti, formati incoerenti e la qualità dei dati attraverso una vasta gamma di connettori e trasformazioni predefinite. Le altre opzioni sono meno efficaci: Convertire in AVRO (o altri formati auto-descrittivi) risolve solo parzialmente il problema dell'incoerenza, ma non esegue la pulizia o la trasformazione dei dati stessi. Caricare in una tabella di staging e trasformare con SQL è possibile, ma Data Fusion offre un approccio più robusto e scalabile per la gestione di trasformazioni complesse e la garanzia della qualità dei dati, specialmente con dati molto sporchi o con schemi variabili. Caricare direttamente e trasformare in loco con SQL è rischioso per la qualità dei dati e può essere inefficiente, specialmente se i dati sono molto incoerenti e richiedono logiche di pulizia complesse.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta