Un trabajo de Dataflow de streaming (Streaming Engine, autoescalado horizontal, max_workers=1000) que lee notificaciones de Pub/Sub desde GCS emite un elemento por línea CSV. El trabajo está utilizando solo 10 workers y el autoescalador no está añadiendo más. ¿Cómo se mejora el paralelismo y se permite que el autoescalador escale?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Cambiar el código de la pipeline para añadir un paso Reshuffle para romper la fusión..
Por qué esta es la respuesta
La opción correcta es añadir un paso Reshuffle porque un trabajo de Dataflow de streaming que no escala a pesar de tener maxworkers altos y un cuello de botella en la lectura de Pub/Sub (desde GCS) a menudo indica un "hot key" o una fusión de datos que impide el paralelismo. Reshuffle rompe esta fusión, distribuyendo los datos de manera más uniforme entre los workers y permitiendo que el autoescalador de Dataflow detecte la necesidad de más workers y los asigne. Habilitar el autoescalado vertical no resuelve el problema de paralelismo, solo aumenta la capacidad de los workers existentes. Aumentar el número máximo de workers no ayuda si el autoescalador no los utiliza debido a la falta de paralelismo. Usar Dataflow Prime y Right Fitting es una solución más avanzada para la optimización de recursos, pero no aborda directamente el problema fundamental de la distribución de datos que impide el escalado horizontal en este escenario.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta