Per file di testo molto grandi che devono supportare ANSI SQL, compressione e caricamento parallelo secondo le best practice di Google, quale pipeline di archiviazione/formato dovresti usare?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Convertire i file di testo in Avro compresso usando Cloud Dataflow; archiviare i file in Cloud Storage ed esporli a BigQuery come tabelle esterne permanenti..
Perché questa è la risposta
La risposta corretta è convertire i file di testo in Avro compresso usando Cloud Dataflow, archiviare i file in Cloud Storage ed esporli a BigQuery come tabelle esterne permanenti. Questo approccio è ottimale perché Avro è un formato row-oriented che supporta la compressione e lo schema, ed è eccellente per l'elaborazione parallela. Cloud Dataflow è ideale per trasformazioni su larga scala. Archiviare in Cloud Storage è conveniente e scalabile. Le tabelle esterne permanenti di BigQuery consentono di interrogare i dati direttamente da Cloud Storage usando SQL standard, senza doverli caricare fisicamente in BigQuery, supportando così grandi volumi di dati e mantenendo la flessibilità. Le altre opzioni sono meno efficienti. Caricare direttamente in BigQuery dopo la conversione in Avro (prima opzione) potrebbe essere costoso per dati molto grandi e meno flessibile. Comprimere in gzip e caricare in BigQuery (terza opzione) è meno efficiente di Avro per l'interrogazione parallela e la gestione dello schema. L'ultima opzione, usare Cloud Bigtable, non è adatta per l'analisi SQL e i casi d'uso di data warehousing.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta