Un job Hadoop ad alta intensità di I/O su disco viene eseguito molto più lentamente su Dataproc utilizzando Cloud Storage per i dati intermedi rispetto a un HDFS bare-metal on-premise. Come si risolve questo problema separando storage e compute?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Effettuare il provisioning di più persistent disk e mantenere i dati intermedi di quel job su HDFS nativo.
Perché questa è la risposta
La risposta corretta è "Effettuare il provisioning di più persistent disk e mantenere i dati intermedi di quel job su HDFS nativo". I job Hadoop ad alta intensità di I/O su disco beneficiano notevolmente della prossimità dei dati al calcolo. Cloud Storage, sebbene scalabile, introduce latenza di rete che può rallentare i job con molti I/O intermedi. Utilizzare HDFS nativo sui dischi persistenti delle VM di Dataproc consente ai dati intermedi di risiedere localmente, riducendo la latenza e migliorando le prestazioni. Assegnare più memoria (RAM) non risolve il problema di I/O su disco, poiché i dati intermedi potrebbero superare la capacità della RAM o non essere gestiti in modo efficiente dalla RAM per tutti i tipi di I/O. Aumentare i core della CPU non aumenta direttamente la larghezza di banda di rete per istanza in modo significativo per compensare la latenza di Cloud Storage. Aggiungere NIC aggiuntive e l'aggregazione di link migliorerebbe il throughput di rete, ma non eliminerebbe la latenza intrinseca dell'accesso a Cloud Storage per i dati intermedi rispetto all'accesso locale su disco.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta