Un trabajo de Dataflow que ingiere archivos de texto comprimidos con gzip utiliza SideInputs para unir datos y escribe los errores en una cola de mensajes fallidos, pero el tiempo de ejecución del trabajo es más largo de lo esperado. ¿Qué cambio acelera la pipeline?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Usar CoGroupByKey en lugar de SideInput..
Por qué esta es la respuesta
Usar CoGroupByKey en lugar de SideInput es la mejor opción para acelerar la pipeline. Los SideInputs son útiles para conjuntos de datos pequeños que caben en la memoria de cada worker. Sin embargo, para conjuntos de datos grandes, el envío de SideInputs a todos los workers puede ser ineficiente y causar cuellos de botella, ralentizando el trabajo. CoGroupByKey, por otro lado, es una transformación diseñada para unir grandes conjuntos de datos de manera distribuida y escalable, lo que resulta en un rendimiento mucho mejor para este escenario. Cambiar a Avro comprimido podría ayudar con la lectura de datos, pero el cuello de botella principal aquí es la unión de datos. Reducir el tamaño del lote generalmente ralentiza el procesamiento debido a la sobrecarga de gestión de lotes más pequeños. Reintentar los registros con errores no acelera la pipeline; de hecho, podría ralentizarla al añadir trabajo adicional.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta