Para un pipeline que lee JSON de Pub/Sub, lo transforma y escribe en BigQuery con un costo mínimo y manejo automático del volumen de entrada variable, ¿qué servicio y enfoque de escalado debería elegir?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Usar Cloud Dataflow para las transformaciones; monitorear el backlog de trabajos con Stackdriver y usar el autoescalado predeterminado para las instancias de trabajadores..
Por qué esta es la respuesta
La opción correcta es usar Cloud Dataflow con autoescalado. Dataflow es un servicio de procesamiento de datos completamente administrado que escala automáticamente los recursos según la carga de trabajo, lo que es ideal para volúmenes de entrada variables y minimiza los costos al pagar solo por los recursos utilizados. Monitorear el backlog de trabajos con Stackdriver (ahora Cloud Monitoring) permite observar la salud del pipeline y cómo el autoescalado responde a los cambios en el volumen de datos. Las opciones de Dataproc son incorrectas porque Dataproc es un servicio administrado de Apache Spark y Hadoop, que requiere más gestión manual del clúster y escalado, lo que no cumple con el requisito de "manejo automático del volumen de entrada variable" y "costo mínimo" tan eficientemente como Dataflow. La opción de Dataflow con monitoreo del tiempo total de ejecución y configuración manual de máquinas no aprovecha el autoescalado automático de Dataflow, lo que iría en contra del requisito de manejo automático del volumen.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta