Google PDE: Orquestación de Flujos de Trabajo y Automatización de Canalizaciones — Guía de estudio

Forma parte de la Google Professional Data Engineer — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Google, o realiza tests cronometrados en ExamRoll.io.

Descripción general

La orquestación de flujos de trabajo y la automatización de pipelines coordinan las tareas de datos entre servicios para que la ingesta, la transformación, los controles de calidad y la publicación se realicen de forma fiable, segura y rentable. En Google Cloud, la orquestación debe alinearse con el modelo de ejecución de cada carga de trabajo: lotes programados, flujos controlados por eventos, ad-hoc o trabajos de larga duración. Los objetivos de diseño son la repetibilidad, la idempotencia, la observabilidad, el privilegio mínimo y la promoción segura a través de los entornos.

Decisiones clave:

El modelo operativo pone énfasis en los reintentos con retroceso exponencial limitado, los tiempos de espera, los SLAs, las puestas al día (catchup) y los rellenos (backfills), el diseño de tareas idempotentes para reejecuciones seguras y un manejo robusto de fallos con captura en colas de mensajes fallidos (dead-letter). La seguridad se implementa mediante cuentas de servicio por pipeline, aislamiento de secretos, parametrización e IAM de privilegio mínimo. CI/CD, la infraestructura como código y una telemetría completa completan un enfoque listo para producción.

Orquestación en Google Cloud: Herramientas y Patrones

Cloud Composer (Airflow)

Cloud Workflows, Cloud Scheduler, trabajos de Cloud Run y ejecución controlada por eventos

Dataform: flujos de trabajo SQL para BigQuery

Dataproc, Dataflow y patrones de almacenamiento

Observabilidad, alertas y runbooks

Telemetría y alertas

Diseño de runbooks

Escenario de un problema práctico

Acme Retail Analytics necesita ingerir entregas diarias de archivos CSV de socios que contienen ocasionalmente filas con formato incorrecto, transformar y cargar los datos válidos a BigQuery, y exponer las filas erróneas para su investigación. También quieren un enriquecimiento basado en eventos para actualizaciones de precios casi en tiempo real y una promoción segura de desarrollo (dev) a producción (prod).

Enfoque:

  1. Almacenamiento y disparadores de eventos

    • Crear un bucket de Cloud Storage dedicado con control de versiones de objetos y acceso uniforme a nivel de bucket. Habilitar notificaciones de finalización de objetos (object finalize) a Pub/Sub a través de Eventarc.
    • Justificación: La finalización de objetos es un evento fiable para disparar la ingesta posterior; el control de versiones permite reejecuciones y auditorías.
  2. Ingesta por lotes con manejo de cola de mensajes fallidos (dead-letter)

    • Usar Cloud Composer para programar un DAG de Airflow diario a las 02:00 con catchup habilitado. El DAG lanza un trabajo por lotes de Dataflow que analiza los CSV, valida el esquema y escribe los registros válidos en BigQuery usando tablas de staging deterministas y luego haciendo MERGE en las tablas de destino particionadas. Enrutar los registros con formato incorrecto o fallidos a una tabla de mensajes fallidos (dead-letter) en BigQuery.
    • Justificación: Dataflow escala el análisis/validación; MERGE asegura la idempotencia; la captura en una cola de mensajes fallidos permite la inspección sin bloquear el pipeline, coincidiendo con el patrón recomendado para filas con formato incorrecto.
  3. Enriquecimiento basado en eventos

    • Desplegar un trabajo de Cloud Run para realizar un enriquecimiento ligero para actualizaciones de precios incrementales. Dispararlo a través de Cloud Workflows que escucha mensajes de Pub/Sub desde Eventarc cuando llegan pequeños archivos de actualización durante el día.
    • Justificación: Los contenedores sin servidor (serverless) con Workflows proporcionan una orquestación de baja latencia y baja sobrecarga operativa para eventos pequeños, mientras se mantienen las transformaciones pesadas en lote.
  4. Controles de fiabilidad

    • Configurar reintentos con retroceso exponencial (exponential backoff) para fallos transitorios en los trabajos de Dataflow y Cloud Run, limitando el tiempo total de reintentos al SLA del DAG. Establecer tiempos de espera de ejecución por tarea y callbacks on_failure en Airflow; en Workflows, establecer max_doublings y max_retry_duration.
    • Justificación: El retroceso acotado (bounded backoff) preserva los SLAs y previene reintentos descontrolados.
  5. Seguridad y mínimo privilegio

    • Ejecutar cada componente bajo una cuenta de servicio (service account) dedicada: SA del orquestador de Composer, SA del worker de Dataflow, SA del trabajo de Cloud Run. Otorgar solo los roles necesarios: lectura de GCS (read) en el bucket de ingesta a Dataflow, dataEditor de BigQuery en los datasets de destino y Viewer en los logs. Almacenar los secretos en Secret Manager y hacer referencia a ellos en tiempo de ejecución.
    • Justificación: Aplica el principio de mínimo privilegio y aísla el radio de impacto (blast radius).
  6. Orquestación basada en metadatos

    • Mantener una tabla de control en BigQuery que liste las fuentes de los socios, los patrones de archivo y los datasets de destino. En tiempo de ejecución del DAG, Airflow consulta esta tabla y utiliza el mapeo dinámico de tareas para generar tareas por cada socio.
    • Justificación: Añadir un socio se convierte en un cambio de datos, no en un cambio de código, reduciendo el riesgo del despliegue.
  7. Observabilidad y alertas

    • Emitir logs estructurados con run_id y partner_id. Crear políticas de alertas para incumplimientos de SLA del DAG, retraso del sistema (system lag) de Dataflow y recuentos no vacíos en la cola de mensajes fallidos. Para las inserciones de BigQuery en la tabla de destino, configurar un receptor (sink) de Cloud Logging con un filtro avanzado para esa tabla hacia un tema de Pub/Sub consumido por la herramienta de monitoreo de Acme.
    • Justificación: Las alertas detalladas (fine-grained) permiten una clasificación rápida de incidentes (triage) sin ruido.
  8. CI/CD y promoción

    • Gestionar la infraestructura (buckets, Pub/Sub, Eventarc, Composer, Workflows, datasets de BigQuery) en Terraform. Usar Cloud Build para validar la sintaxis de los DAGs de Airflow, ejecutar pruebas unitarias y desplegar a un entorno de desarrollo (dev) de Composer. Promover a los entornos de pruebas (test) y producción (prod) con configuraciones parametrizadas y puertas de aprobación manual después de que las aserciones de Dataform y las pruebas de integración pasen.
    • Justificación: Despliegues declarativos y repetibles y promoción segura entre entornos.
  9. Runbook y recuperación

    • Documentar los pasos para reprocesar una fecha específica: restaurar el CSV desde el control de versiones de objetos, reejecutar el trabajo de Dataflow para esa partición, hacer MERGE de los resultados y revisar los registros de la DLQ. Incluir un procedimiento de “repetición de un conjunto de datos fijo” (fixed dataset replay) para aislar errores de transformación si surgen discrepancias.
    • Justificación: Un diseño idempotente y una recuperación documentada agilizan la remediación de fallos parciales.

Ingesta · Todos los dominios · Machine Learning

Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Aprueba tu examen →

Explorar Google →

Related guides

Acceso todo en uno

Una suscripción. Todos los exámenes.

Cada plan desbloquea la búsqueda ilimitada de respuestas, pruebas de práctica, explicaciones de AI y la biblioteca completa de recursos, en más de 20 idiomas.

Mensual
24.87
Just €0.83/day
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

Mejor valor
12 meses
179.87
Just €0.49/daySave 40%
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

✓ Plan gratuito incluido · ✓ Cancela en cualquier momento · ✓ Todos los planes desbloquean el producto completo