Un trabajo de Cloud Dataflow que utiliza ventanas y transformaciones en datos de streaming de Pub/Sub falla en la inserción de streaming. ¿Cuál es la causa más probable?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: No se aplicó una función de ventana no global (sharded), lo que provocó que el trabajo fallara en la creación del pipeline..
Por qué esta es la respuesta
En Cloud Dataflow, cuando se procesan datos de streaming con ventanas, especialmente con transformaciones que agrupan elementos (como GroupByKey), es crucial que los datos se distribuyan entre los workers para evitar cuellos de botella. Si no se aplica una función de ventana no global (sharded), como una ventana fija o deslizante, Dataflow intentará procesar todos los datos en una única ventana global, lo que puede sobrecargar un solo worker y causar un fallo en la inserción de streaming debido a la falta de paralelismo y la incapacidad de escalar. Las marcas de tiempo de eventos son importantes para el procesamiento correcto de ventanas, pero su ausencia generalmente no causa un fallo en la inserción, sino resultados incorrectos o retrasados. Los triggers controlan cuándo se emiten los resultados de una ventana, no si el pipeline falla al insertar datos. Una ventana global, por sí misma, no es la causa del fallo si los datos se pueden procesar en un solo worker; el problema surge cuando se espera paralelismo y no se configura una ventana sharded.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta