Necesita un flujo de trabajo eficiente y mantenible para procesar cientos de tablas: los archivos llegan a Cloud Storage de forma impredecible, Dataproc los transforma y los escribe en BigQuery, y luego se ejecutan transformaciones de BigQuery específicas de la tabla (lo que puede llevar horas). ¿Cuál es el mejor diseño de flujo de trabajo?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: 1. Cree un DAG de Airflow en Cloud Composer usando operadores de Dataproc y BigQuery. 2. Cree un DAG separado por tabla. 3. Use un activador de objetos de Cloud Storage para iniciar una Cloud Function que active el DAG..
Por qué esta es la respuesta
La opción correcta es la mejor porque aborda la imprevisibilidad de la llegada de archivos y la necesidad de un procesamiento específico de la tabla. Usar un activador de objetos de Cloud Storage con una Cloud Function permite que el flujo de trabajo se inicie solo cuando un archivo llega, lo que es eficiente para entradas impredecibles. Crear un DAG separado por tabla garantiza que las transformaciones de BigQuery específicas de la tabla se manejen correctamente, incluso si tardan horas. Las opciones incorrectas son menos eficientes o mantenibles. Programar un DAG cada hora (opciones 1 y 2) es ineficiente si los archivos no llegan con regularidad. Usar un único DAG compartido para todas las tablas (opciones 1 y 3) dificultaría la gestión de las transformaciones de BigQuery específicas de la tabla y podría llevar a fallos en cascada si una tabla tiene problemas.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta