Google PDE: Almacenamiento de Datos, Lagos y Formatos de Archivo — Guía de estudio

Forma parte de la Google Professional Data Engineer — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Google, o realiza tests cronometrados en ExamRoll.io.

Descripción general

El almacenamiento de datos en Google Cloud abarca desde el almacenamiento de objetos sin procesar hasta los data lakes curados y los formatos optimizados para el análisis. Construir lagos de datos fiables, gobernados y de alto rendimiento requiere elecciones cuidadosas en cuanto a clases de almacenamiento, configuración de buckets, ubicaciones, formatos de archivo, diseño de tablas y ciclo de vida. Esta sección detalla las compensaciones de diseño, los modos de fallo que se deben evitar y los patrones que se alinean con BigQuery, Spark y las canalizaciones de streaming a escala.

Fundamentos de Cloud Storage: clases, buckets, consistencia y ciclo de vida

Cloud Storage es la base duradera y de alta disponibilidad para archivos sin procesar y curados.

Gobernanza unificada del lago de datos con BigLake y Dataplex

BigLake y Dataplex estandarizan la seguridad y la gobernanza en archivos y tablas.

Formatos de archivo, compresión y comportamiento de las consultas

Elegir el formato correcto tiene efectos de primer orden en el costo y el rendimiento.

Disposición, particionamiento, ingeniería de rendimiento, residencia y migración

Escenario de un problema práctico

Acme Retail recibe entregas diarias de archivos CSV de un socio logístico en un bucket regional de Cloud Storage. Ocasionalmente, los archivos contienen filas con formato incorrecto. Acme debe recibir, validar, convertir a un formato listo para analítica y cargar en BigQuery para paneles de control casi en tiempo real, mientras conserva las filas erróneas para su inspección y aplica la gobernanza.

Enfoque:

  1. Recibir y gobernar datos crudos en Dataplex

    • Crear un lago de datos (lake) en Dataplex con un activo de zona cruda (raw zone) mapeado a gs://acme-raw/logistics/.
    • Justificación: Gobernanza, metadatos y linaje de datos centralizados. Aplicar IAM a nivel de zona y etiquetar los campos sensibles con etiquetas de política (policy tags) para su aplicación en sistemas posteriores.
  2. Aplicar ciclo de vida y retención

    • Aplicar una política de retención de 30 días al bucket y habilitar el versionamiento de objetos en acme-raw.
    • Justificación: Protege contra sobrescrituras/eliminaciones accidentales por parte del socio; una retención corta equilibra el costo y la recuperabilidad. El versionamiento facilita la reversión de entregas defectuosas.
  3. Validar e ingerir con una canalización (pipeline) de lotes de Dataflow

    • Disparar un trabajo diario de Dataflow mediante notificaciones de finalización de objeto. Leer el CSV con un esquema y validación por registro; escribir los registros válidos en un área de preparación (staging) de BigQuery (particionada por event_date) y enrutar los errores de análisis/validación a una tabla de BigQuery de mensajes fallidos (dead-letter).
    • Justificación: Dataflow proporciona un análisis paralelo escalable y un manejo robusto de mensajes fallidos para que los analistas puedan inspeccionar las filas erróneas. Esto refleja las mejores prácticas para calidades heterogéneas de CSV.
  4. Compactar y convertir a Parquet en una zona curada

    • La misma canalización escribe los datos validados en gs://acme-curated/logistics/date=YYYY-MM-DD/ como archivos Parquet con un tamaño de ~256–512 MB.
    • Justificación: Parquet permite la poda de columnas (column pruning) y el empuje de predicados (predicate pushdown) en BigQuery y Spark, reduciendo los bytes escaneados y mejorando la latencia; la compactación mitiga la sobrecarga de los archivos pequeños proveniente del patrón de entrega del socio.
  5. Exponer analítica gobernada a través de BigLake

    • Crear una tabla externa de BigLake sobre la ruta de Parquet curada con auto-particionamiento de Hive; aplicar etiquetas de política a nivel de columna y políticas de acceso a nivel de fila para filtros específicos del socio.
    • Justificación: Acceso uniforme y de grano fino a través de BigQuery y Spark con auditoría centralizada. La poda de particiones (partition pruning) reduce los costos de escaneo en los filtros de fecha.
  6. Cargar agregados críticos a BigQuery nativo

    • Para paneles de control de alta demanda (hot), ejecutar un trabajo programado de BigQuery que ingiera los últimos N días desde la tabla externa de Parquet curada a una tabla nativa particionada y en clúster.
    • Justificación: El almacenamiento nativo acelera la BI de alta concurrencia, mientras que la tabla externa de BigLake permanece como el sistema de registro gobernado para un acceso más amplio.
  7. Monitorear y alertar con Cloud Logging y Pub/Sub

    • Crear un receptor de registros (log sink) que filtre los resultados de los trabajos de carga de Dataflow y BigQuery hacia Pub/Sub; integrarlo con la herramienta de monitoreo para alertas instantáneas sobre fallos o tasas elevadas de filas erróneas.
    • Justificación: Visibilidad operativa dirigida y específica de la tabla sin sondeo (polling); apoya las prácticas de SRE.
  8. Optimizar la clase de almacenamiento y la residencia de datos

    • Mantener el Parquet curado en Standard durante 14 días, transferirlo a Coldline después de 30 días mediante una regla de ciclo de vida; almacenar los buckets crudos y curados en la misma región que los conjuntos de datos de BigQuery para evitar el egreso.
    • Justificación: Equilibra el rendimiento de lectura frecuente (hot) con el costo. La coubicación mantiene el cumplimiento y minimiza la latencia y las tarifas de egreso.
  9. Validar la calidad de extremo a extremo

    • Después de cada ejecución, comparar recuentos y agregados de hash entre las tablas de preparación (staging), externa curada y nativa de BigQuery; poner en cuarentena las anomalías.
    • Justificación: Detección temprana de derivas de esquema o regresiones en la ingesta; los hashes criptográficos o de huella digital (fingerprint) proporcionan una garantía ligera sin necesidad de re-escaneos completos.

Este diseño proporciona una ingesta resiliente con análisis de mensajes fallidos, Parquet listo para analítica para consultas eficientes, gobernanza centralizada a través de Dataplex y BigLake, y políticas de ciclo de vida optimizadas en costos, todo mientras se adhiere al acceso de mínimo privilegio y a operaciones auditables.


Arquitectura y Diseño de Ingeniería de Datos · Todos los dominios · Analítica de BigQuery e Ingeniería de Almacenes de Datos

Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Aprueba tu examen →

Explorar Google →

Related guides

Acceso todo en uno

Una suscripción. Todos los exámenes.

Cada plan desbloquea la búsqueda ilimitada de respuestas, pruebas de práctica, explicaciones de AI y la biblioteca completa de recursos, en más de 20 idiomas.

Mensual
24.87
Just €0.83/day
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

Mejor valor
12 meses
179.87
Just €0.49/daySave 40%
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

✓ Plan gratuito incluido · ✓ Cancela en cualquier momento · ✓ Todos los planes desbloquean el producto completo