Un job Dataflow di streaming (Streaming Engine, autoscaling orizzontale, max_workers=1000) che legge le notifiche Pub/Sub da GCS emette un elemento per riga CSV. Il job utilizza solo 10 worker e l'autoscaler non ne aggiunge altri. Come si può migliorare il parallelismo e consentire all'autoscaler di scalare?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Modificare il codice della pipeline per aggiungere un passaggio Reshuffle per interrompere la fusione..
Perché questa è la risposta
La risposta corretta è "Modificare il codice della pipeline per aggiungere un passaggio Reshuffle per interrompere la fusione". Questo perché un numero limitato di worker (10 su 1000) e l'assenza di autoscaling indicano un problema di fusione (fusion) delle operazioni. Dataflow raggruppa le operazioni per ottimizzare le risorse, ma a volte questo impedisce il parallelismo. Un Reshuffle forza Dataflow a materializzare i dati, interrompendo la fusione e permettendo all'autoscaler di distribuire il lavoro su più worker. Le altre opzioni sono meno efficaci: L'autoscaling verticale non risolve il problema del parallelismo se il lavoro non è distribuito. Aumentare il numero massimo di worker non ha effetto se l'autoscaler non ne aggiunge di nuovi a causa della fusione. Dataflow Prime e Right Fitting sono soluzioni per l'ottimizzazione delle risorse, ma non risolvono direttamente il problema della fusione che impedisce lo scaling orizzontale.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta