Un job Spark di Dataproc con molti shuffle legge file parquet di circa 200-400 MB ciascuno e viene eseguito su worker preemptible con solo due nodi non preemptible. Per migliorare le prestazioni in modo economicamente vantaggioso, quale modifica dovresti apportare?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Passare da HDD a SSD, sovrascrivere la configurazione delle VM preemptible per aumentare la dimensione del disco di avvio..
Perché questa è la risposta
La risposta corretta è "Passare da HDD a SSD, sovrascrivere la configurazione delle VM preemptible per aumentare la dimensione del disco di avvio." I job Spark con molti shuffle sono intensivi in I/O su disco, specialmente quando i dati intermedi vengono scritti e letti. I dischi SSD offrono prestazioni di I/O significativamente superiori rispetto agli HDD, riducendo i tempi di lettura/scrittura e migliorando l'efficienza degli shuffle. Aumentare la dimensione del disco di avvio sulle VM preemptible è importante perché lo spazio su disco è utilizzato per lo shuffle e per i dati temporanei di Spark. Aumentare la dimensione dei file Parquet a 1 GB potrebbe non essere la soluzione più economica o efficace, poiché i file da 200-400 MB sono già di dimensioni ragionevoli e il problema principale è l'I/O del disco, non la dimensione dei file. Passare a TFRecords non risolverebbe il problema di I/O, poiché il formato del file non è la causa principale del collo di bottiglia. Copiare i dati da GCS a HDFS e viceversa introdurrebbe un overhead aggiuntivo e non risolverebbe il problema di I/O sottostante dei dischi.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta