Google PDE: Gobernanza de Datos, Seguridad, Confiabilidad y Operaciones de Costos — Guía de estudio

Forma parte de la Google Professional Data Engineer — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Google, o realiza tests cronometrados en ExamRoll.io.

Descripción general

Esta sección resume los patrones de diseño y las prácticas operativas para la gobernanza de datos, la seguridad, la fiabilidad y las operaciones de costos en Google Cloud. Se centra en BigQuery, Cloud Storage, Dataflow, Dataplex y servicios de soporte. Se pone énfasis en el privilegio mínimo, la gestión de claves de cifrado, los metadatos y la clasificación, el acceso basado en políticas, la evidencia de cumplimiento, la observabilidad con SLO procesables y el control de costos. Se incluyen compensaciones, modos de fallo y configuraciones prácticas para habilitar plataformas de datos seguras, auditables y eficientes.

Identidad, Acceso y Gobernanza

undefined

undefined

Operaciones de seguridad y cumplimiento

Fiabilidad, Observabilidad, Calidad y Gestión de Costos

Escenario de Problema Práctico

NovaRetail Analytics se asocia con múltiples marcas para ingerir archivos CSV diarios que contienen datos de transacciones en una plataforma de análisis compartida. Los archivos llegan a un bucket de aterrizaje (landing) en Cloud Storage y ocasionalmente incluyen filas con formato incorrecto. La plataforma debe aplicar el mínimo privilegio para que cada cliente solo pueda acceder a sus propios datos, detectar campos sensibles y proporcionar alertas inmediatas cuando se añaden filas a una tabla de auditoría específica. La empresa también necesita controles de costos y un plan de recuperación.

Enfoque:

  1. Aislar a los tenants y aplicar el mínimo privilegio

    • Crear un dataset de BigQuery dedicado por cliente (p. ej., client_a_analytics). Otorgar solo al grupo del cliente los roles de dataset apropiados (bigquery.dataViewer, bigquery.jobUser) y restringir el uso de la API de BigQuery a usuarios aprobados mediante IAM y VPC-SC si aplica.
    • Justificación: Un dataset por tenant limita el radio de impacto (blast radius) y simplifica la complejidad de las políticas a nivel de fila. El alcance de mínimo privilegio a nivel de dataset previene el acceso entre tenants por defecto.
  2. Gobernar el esquema, la clasificación y el enmascaramiento

    • Definir una taxonomía de etiquetas de política (policy tags) en Data Catalog (público, interno, confidencial, restringido) y plantillas de etiquetas para propietario, data steward y RTO/RPO. Adjuntar las etiquetas de política a columnas sensibles (email, card_suffix) en el dataset de cada cliente. Aplicar políticas de enmascaramiento de BigQuery para restringir las vistas a roles no privilegiados.
    • Ejemplo:

undefined

.

  1. Descubrir PII y aplicar desidentificación donde sea necesario

    • Configurar el descubrimiento de Sensitive Data Protection para escanear el bucket de aterrizaje y las tablas curadas de BigQuery. Usar una plantilla de inspección para PII común y una plantilla de desidentificación para tokenizar los correos electrónicos de forma determinista para casos de uso con joins.
    • Justificación: El descubrimiento automatizado reduce los errores manuales; la tokenización determinista equilibra la privacidad con los requisitos de join en el análisis.
  2. Asegurar el pipeline con cuentas de servicio, suplantación (impersonation) y CMEK

    • Usar una cuenta de servicio de Dataflow solo con los roles necesarios: storage.objectViewer en el bucket de aterrizaje, bigquery.dataEditor en los datasets de destino y acceso a las etiquetas de política si es necesario. Usar CMEK para los datasets del cliente y otorgar a los agentes de servicio de BigQuery y Dataflow el rol CryptoKey Encrypter/Decrypter.
    • Justificación: Roles específicos junto con CMEK cumplen con los requisitos de mínimo privilegio y control de claves. El acceso de los agentes de servicio a las claves previene fallos en los trabajos.
  3. Construir una ingesta resiliente con cuarentena de errores

    • Ejecutar un trabajo de Dataflow en modo batch que lea los CSV, valide el esquema y escriba las filas válidas en tablas particionadas de BigQuery. Dirigir las filas inválidas a una tabla de dead-letter en BigQuery con detalles del error (nombre del archivo, línea, motivo).
    • Justificación: Las salidas secundarias (side outputs) preservan los datos erróneos para su análisis sin bloquear los datos correctos; las tablas particionadas reducen el costo de escaneo y aceleran las consultas.
  4. Crear linaje y metadatos de negocio

    • Registrar el bucket de aterrizaje y los datasets como activos de Dataplex en un lake. Habilitar la recolección de linaje para el trabajo de Dataflow y etiquetar las tablas curadas con metadatos de negocio (propietario de los datos, sensibilidad, retención).
    • Justificación: La gobernanza centralizada permite el análisis de impacto, la preparación para auditorías y una gestión (stewardship) estandarizada.
  5. Monitorear, alertar y auditar

    • Habilitar los registros de auditoría de Admin y Data Access, exportados con CMEK a un proyecto de logging central y a BigQuery para análisis. Añadir una alerta basada en registros para nuevas filas añadidas a la tabla de auditoría usando un filtro avanzado en los trabajos de inserción de BigQuery; exportar ese sink a Pub/Sub para que la herramienta de monitoreo lo consuma.
    • Justificación: Los registros son evidencia resistente a la manipulación; las alertas específicas notifican solo sobre la tabla requerida, reduciendo el ruido.
  6. Aplicar controles de costos y barreras de protección (guardrails) para consultas

    • Requerir que los trabajos de consulta establezcan maximumBytesBilled y aprovechar el clustering en columnas de alta cardinalidad (p. ej., order_id). Aplicar presupuestos y establecer etiquetas (labels) (cliente, entorno) en trabajos y datasets. Usar BigQuery Reservations para separar el análisis interactivo de las cargas programadas.
    • Justificación: Las barreras de protección previenen costos descontrolados; las etiquetas permiten la refacturación (chargeback); el aislamiento de slots mantiene un rendimiento predecible.
  7. Implementar retención y recuperación ante desastres (DR)

    • En el bucket de aterrizaje, habilitar el versionado de objetos y una regla de ciclo de vida para eliminar objetos después de 30 días; establecer una política de retención para zonas de cumplimiento normativo. En BigQuery, establecer una expiración de tabla por defecto para las tablas de staging y tomar snapshots periódicos de las tablas curadas. Almacenar los procedimientos de copia de seguridad de KMS y los pasos de restauración de tablas en runbooks y probarlos trimestralmente.
    • Justificación: La gestión del ciclo de vida reduce el costo de almacenamiento; los snapshots y los runbooks documentados aseguran la recuperabilidad. Las pruebas validan las suposiciones de RTO/RPO.
  8. Revisiones periódicas de acceso y SLIs/SLOs de calidad

    • Trimestralmente, exportar las políticas de IAM con Cloud Asset Inventory y compararlas con una línea base aprobada. Definir SLOs como “99% de los archivos diarios procesados en 30 minutos desde su llegada” con alertas sobre la tasa de consumo (burn rate). Monitorear los SLIs de calidad de datos (completitud, validez) usando las reglas de Dataplex Data Quality y dirigir las violaciones a la respuesta de incidentes con automatización de backfill.
    • Justificación: La revisión regular previene la acumulación de privilegios (privilege creep); las operaciones basadas en SLOs alinean el esfuerzo con la experiencia del usuario; las verificaciones de calidad automatizadas detectan regresiones tempranamente.

Compromisos técnicos y modos de fallo abordados:


Machine Learning · Todos los dominios

Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Aprueba tu examen →

Explorar Google →

Related guides

Acceso todo en uno

Una suscripción. Todos los exámenes.

Cada plan desbloquea la búsqueda ilimitada de respuestas, pruebas de práctica, explicaciones de AI y la biblioteca completa de recursos, en más de 20 idiomas.

Mensual
24.87
Just €0.83/day
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

Mejor valor
12 meses
179.87
Just €0.49/daySave 40%
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

✓ Plan gratuito incluido · ✓ Cancela en cualquier momento · ✓ Todos los planes desbloquean el producto completo