Een streaming Dataflow-taak (Streaming Engine, horizontale autoscaling, max_workers=1000) die Pub/Sub-notificaties van GCS leest, zendt één element per CSV-regel uit. De taak gebruikt slechts 10 workers en de autoscaler voegt er geen meer toe. Hoe verbetert u de parallellisatie en laat u de autoscaler schalen?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Wijzig de pipelinecode om een Reshuffle-stap toe te voegen om fusion te doorbreken..
Waarom dit het antwoord is
De correcte optie is om een Reshuffle-stap toe te voegen. Dit forceert Dataflow om de gegevens te materialiseren en opnieuw te distribueren over de workers, waardoor de fusion van stappen wordt doorbroken. Fusion treedt op wanneer Dataflow meerdere stappen samenvoegt tot één uitvoeringsfase om overhead te verminderen. Als een van deze samengevoegde stappen een bottleneck is, kan dit de parallellisatie beperken. Door fusion te doorbreken, kunnen meer workers onafhankelijk aan verschillende delen van de data werken, waardoor de parallellisatie verbetert en de autoscaler de mogelijkheid krijgt om op te schalen. Vertical autoscaling (optie 1) verhoogt de capaciteit van bestaande workers, maar lost het probleem van onvoldoende parallellisatie niet op als de bottleneck in de dataverdeling zit. Het verhogen van het maximale aantal workers (optie 3) helpt niet als de autoscaler niet opschaalt vanwege fusion. Dataflow Prime met Right Fitting (optie 4) is een geavanceerde functie, maar lost het onderliggende fusion-probleem niet direct op dat de autoscaler verhindert om te schalen.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig