Si desidera ricostruire una pipeline batch PySpark lenta utilizzando un approccio serverless basato su SQL. I dati raw si trovano in Cloud Storage. Come si dovrebbe implementare la pipeline per accelerare lo sviluppo e il runtime?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Caricare i dati in BigQuery da Cloud Storage, tradurre le trasformazioni PySpark in BigQuery SQL e scrivere i risultati in una nuova tabella BigQuery..
Perché questa è la risposta
La risposta corretta è caricare i dati in BigQuery da Cloud Storage, tradurre le trasformazioni PySpark in BigQuery SQL e scrivere i risultati in una nuova tabella BigQuery. Questo approccio sfrutta la natura serverless e le alte prestazioni di BigQuery per l'elaborazione SQL, accelerando sia lo sviluppo (grazie alla familiarità con SQL) sia il runtime. Le altre opzioni sono meno efficienti per questo scenario: Convertire PySpark in SparkSQL ed eseguirlo su Dataproc mantiene un ambiente basato su Spark, che non è completamente serverless e potrebbe non offrire lo stesso miglioramento di runtime di BigQuery per carichi di lavoro SQL. Importare i dati in Cloud SQL è meno scalabile e più costoso per grandi volumi di dati rispetto a BigQuery, e l'uso di query federate per il ML non risolve la lentezza della pipeline di trasformazione iniziale. Reimplementare con Apache Beam Python SDK è un'opzione valida per pipeline batch/stream, ma la domanda specifica un approccio "serverless basato su SQL", per cui BigQuery SQL è più diretto e performante per questo requisito.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta