Un job Dataflow de streaming (Streaming Engine, autoscaling horizontal, max_workers=1000) lisant les notifications Pub/Sub depuis GCS émet un élément par ligne CSV. Le job n'utilise que 10 workers et l'autoscaler n'en ajoute pas d'autres. Comment améliorer le parallélisme et permettre à l'autoscaler de scaler ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Modifier le code du pipeline pour ajouter une étape Reshuffle afin de briser la fusion..
Pourquoi c'est la réponse
L'ajout d'une étape Reshuffle (ou d'une transformation qui force un brassage comme GroupByKey ou Combine.perKey) est la bonne solution car elle force Dataflow à briser la fusion des étapes et à redistribuer les données. Cela crée de nouveaux points de parallélisme, permettant à l'autoscaler de détecter un travail non parallélisé et de provisionner davantage de workers pour traiter les données en parallèle. L'activation de l'autoscaling vertical ou l'utilisation de Dataflow Prime avec Right Fitting augmenteraient la capacité des workers existants, mais ne résoudraient pas le problème fondamental d'un pipeline qui ne peut pas paralléliser le travail sur plus de workers. Augmenter le nombre maximal de workers ne sert à rien si le pipeline n'est pas structuré pour utiliser plus de workers.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise