Google PDE: Machine Learning, AI y Servicio de Datos — Guía de estudio
Forma parte de la Google Professional Data Engineer — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Google, o realiza tests cronometrados en ExamRoll.io.
Descripción general
La creación de sistemas de aprendizaje automático y de servicio de datos de nivel de producción en Google Cloud requiere un modelado de datos disciplinado, canalizaciones robustas y barreras de protección operativas. Esta sección cubre el desarrollo de modelos en BigQuery ML, el ciclo de vida gestionado en Vertex AI (conjuntos de datos, entrenamiento, canalizaciones, puntos de conexión, ingeniería de características y monitorización), el diseño de la ruta de predicción (por lotes frente a en línea), los almacenes de características y la corrección en un punto en el tiempo, el etiquetado y los controles de sesgo, la búsqueda de vectores y los patrones de generación aumentada por recuperación, el linaje y la gobernanza, la monitorización de la deriva y los activadores de reentrenamiento, las capas de servicio de analíticas y el uso de datos consciente de la privacidad. Se hace hincapié en las decisiones de diseño, las estrategias de escalado y los modos de fallo comunes que se deben evitar.
BigQuery ML e ingeniería de características
BigQuery ML permite el entrenamiento, la evaluación y la predicción directamente en SQL, eliminando el movimiento de datos y alineando el desarrollo de modelos con los conjuntos de datos analíticos.
Creación de modelos: use CREATE MODEL con columnas de etiquetas explícitas y transformaciones de características para evitar la fuga de datos (leakage) y estandarizar las entradas. Ejemplo: CREATE OR REPLACE MODEL ds.churn_model OPTIONS( model_type=‘logistic_reg’, input_label_cols=[‘churned’], l1_reg=0.0, l2_reg=1.0, data_split_method=‘AUTO’ ) TRANSFORM( standardize(tenure_months) AS tenure_std, quantile_bucketize(monthly_spend, 10) AS spend_bkt, one_hot_encoder(region) AS region_ohe, ml.feature_cross(struct(bucketize(lat, 60), bucketize(lon, 60))) AS latlon_cross, (xx + yy) AS r2 – añadir soporte para límites de decisión circulares cuando sea útil ) AS SELECT churned, tenure_months, monthly_spend, region, lat, lon, x, y FROM ds.customer_features;
Evaluación: use ML.EVALUATE para obtener métricas apropiadas para el tipo de modelo (p. ej., ROC AUC para clasificación, RMSE para regresión). Realice un seguimiento de las bases de referencia y los intervalos de confianza; mantenga los conjuntos de datos de evaluación ordenados por tiempo para aproximar el rendimiento futuro. SELECT * FROM ML.EVALUATE(MODEL ds.churn_model, TABLE ds.eval_features);
Predicción: use ML.PREDICT para una puntuación (scoring) de tipo en línea en BigQuery, o exporte modelos para servirlos en otro lugar. Considere los presupuestos de latencia del modelo cuando use BigQuery para la puntuación síncrona; para APIs de alto QPS, despliegue en puntos de conexión gestionados (managed endpoints). SELECT user_id, predicted_churn FROM ML.PREDICT(MODEL ds.churn_model, TABLE ds.scoring_candidates);
Transformaciones de características: prefiera las funciones declarativas de TRANSFORM (standardize, one_hot_encoder, bucketize, quantile_bucketize, ml.feature_cross) para la reproducibilidad y para vincular el preprocesamiento al artefacto del modelo. Mantenga las transformaciones idempotentes y deterministas.
Consideraciones operativas y modos de fallo:
- Inserciones de streaming y actualidad de las consultas: el streaming de BigQuery tiene consistencia eventual. Para agregaciones en tiempo real que deben incluir filas recién escritas, ejecute consultas con un retardo de tiempo que exceda la latencia medida del búfer de streaming. Un punto de partida conservador es esperar aproximadamente 2 veces el retardo de disponibilidad promedio observado, o diseñar marcas de agua (watermarks) y el manejo de datos tardíos en Dataflow antes de cargarlos en BigQuery.
- Costo y concurrencia: si los límites de concurrencia de slots bajo demanda se convierten en un cuello de botella, cambie a reservas de tarifa plana o flexibles e implemente la gestión de la carga de trabajo (jerarquías y asignaciones de reservas) para garantizar una capacidad predecible.
- Calidad de los datos: para cargas por lotes de GCS con filas con formato incorrecto, use Dataflow para analizar y validar registros, escribiendo las filas correctas en BigQuery y las filas incorrectas en una tabla de mensajes fallidos (dead-letter table) para su inspección. Evite que BigQuery rechace archivos completos debido a un pequeño número de filas incorrectas.
Ciclo de vida de Vertex AI, rutas de predicción y almacenes de características
Vertex AI proporciona servicios gestionados de extremo a extremo para entrenamiento, canalizaciones, registro de modelos, endpoints y monitoreo.
Conjuntos de datos y entrenamiento: registra conjuntos de datos y metadatos; utiliza trabajos de entrenamiento personalizados o AutoML cuando sea apropiado. Elige algoritmos según las restricciones:
- Las cargas de trabajo en una sola VM con recursos limitados favorecen modelos simples (p. ej., regresión lineal o regresión logística) debido a sus bajas demandas de memoria/CPU.
- Las tareas de alta dimensionalidad a menudo se benefician de la selección de características o de la combinación de características redundantes para acelerar el entrenamiento con una pérdida mínima de precisión.
- La detección de anomalías no supervisada es adecuada cuando los ejemplos positivos son escasos y se espera que las anomalías futuras se parezcan a las firmas anómalas conocidas.
Canalizaciones: implementa Vertex AI Pipelines para codificar la preparación de datos, el entrenamiento, la evaluación y las puertas de despliegue. Persiste parámetros, SHAs de commits de código, resúmenes (digests) de contenedores e instantáneas de conjuntos de datos para garantizar la reproducibilidad.
Endpoints y predicción:
- Predicción en línea para cargas de trabajo de baja latencia. Configura réplicas mínimas y máximas y políticas de autoescalado; perfila la latencia del modelo en P95 y establece los SLOs correspondientes. Añade despliegues canary y división de tráfico para lanzamientos seguros.
- Predicción por lotes para trabajos donde el rendimiento (throughput) es prioritario (p. ej., puntuación nocturna). El procesamiento por lotes evita la sobrecarga por solicitud y es más económico para grandes volúmenes, pero ofrece una latencia más alta.
Ingeniería de características y almacenes de características: utiliza Vertex AI Feature Store para:
- Almacén sin conexión (offline) en BigQuery para el entrenamiento.
- Almacén en línea (online) para búsquedas de baja latencia por ID de entidad. Asegura la consistencia entre entrenamiento y servicio (training-serving consistency) compartiendo la misma lógica de transformación (p. ej., una biblioteca de Dataflow o definiciones de características) y usando marcas de tiempo de características para evitar la fuga de datos (leakage). Mantén la corrección en un punto en el tiempo (point-in-time) con uniones temporales:
undefined
Compromisos de diseño:
- Latencia del almacén en línea vs. actualidad de los datos: los almacenes en línea respaldados por Bigtable proporcionan baja latencia; asegura que las cargas masivas (backfills) y los upserts en streaming sean idempotentes. Un sesgo de escritura excesivo o claves calientes (hot keys) degradan el rendimiento: diseña los IDs de entidad para distribuir el tráfico de manera uniforme.
- Lotes vs. en línea: el procesamiento por lotes reduce la complejidad y el costo del servicio, pero puede proporcionar predicciones desactualizadas. Para comportamientos dinámicos (p. ej., recomendaciones), combina el reentrenamiento periódico con características actualizadas en el momento del servicio.
Calidad de los datos, etiquetado, sesgo, privacidad y gobernanza
Las etiquetas de alta calidad y una gobernanza rigurosa son la base de los modelos confiables.
Etiquetado y desequilibrio:
- Utiliza directrices de etiquetado claras y muestreo de control de calidad (QA). Realiza un seguimiento del acuerdo entre anotadores.
- Aborda el desequilibrio de clases con muestreo estratificado, reponderación o remuestreo; monitorea la precisión/exhaustividad (precision/recall) por clase, no solo la exactitud (accuracy) general.
- Conserva los nulos intencionalmente. Si un modelo requiere entradas numéricas, codifica los nulos explícitamente (p. ej., 0 con un indicador “was_null”) y valida el impacto aguas abajo; evita descartar silenciosamente la ausencia informativa de datos.
Sobreajuste y generalización:
- Las mitigaciones incluyen datos de entrenamiento más diversos, conjuntos de características más pequeños y una regularización más fuerte.
- La detención temprana y la validación cruzada son esenciales para las redes neuronales; el submuestreo puede reducir el tiempo de entrenamiento cuando el escalado de la arquitectura o del hardware no es viable.
Gobernanza y linaje:
- Rastrea el linaje con Vertex ML Metadata, Model Registry y Data Catalog. Registra versiones de conjuntos de datos, transformaciones, hiperparámetros y el entorno.
- Flujos de trabajo de aprobación: requiere aprobación humana antes del despliegue, utilizando los estados de Model Registry y Cloud Build/Deploy con verificaciones de políticas. Almacena los artefactos en Artifact Registry; firma los contenedores y aplica Binary Authorization para lanzamientos controlados (gated).
Monitoreo, deriva y reentrenamiento:
- Habilita el monitoreo de modelos para el sesgo de predicción, la deriva de características y la degradación del rendimiento. Utiliza métricas distribucionales (p. ej., PSI, divergencia KL) y una evaluación consciente del retraso de los datos de referencia (ground-truth) donde las etiquetas llegan con retraso.
- Establece activadores de reentrenamiento basados en una deriva estadísticamente significativa, incumplimientos de SLO o ventanas de eventos de negocio. Automatiza las canalizaciones de reentrenamiento, pero controla la promoción con evaluaciones y verificaciones de sesgo.
- Ten cuidado con la deriva silenciosa de datos proveniente de cambios de esquema aguas arriba; aplica contratos de esquema y alerta sobre características faltantes o desplazadas.
Diseño consciente de la privacidad:
- Clasifica los datos utilizando etiquetas de política (policy tags) de Data Catalog; aplica seguridad a nivel de columna y de fila en BigQuery, con políticas de enmascaramiento de datos.
- Minimiza la recopilación de datos; implementa SLAs de retención y eliminación de datos vinculados a la limitación de su propósito.
- Aplica DLP para el descubrimiento y la desidentificación; cifra los datos con CMEK; aísla los servicios con VPC Service Controls; asegura un IAM de grano fino y utiliza cuentas de servicio dedicadas con el mínimo privilegio.
- Para el monitoreo y el registro de logs, redacta la PII (información de identificación personal) y evita registrar las cargas útiles (payloads) cuando no sea necesario.
Búsqueda de vectores, canalizaciones RAG y capas de servicio de análisis
La recuperación y el servicio modernos requieren tanto componentes nativos de vectores como almacenes de análisis probados.
Búsqueda de vectores y embeddings:
- Usa Vertex AI Vector Search o la búsqueda de vectores de BigQuery para la recuperación de vecinos más cercanos a gran escala y con baja latencia; elige AlloyDB para PostgreSQL con pgvector para semántica centrada en la aplicación y necesidades transaccionales.
- Genera embeddings por lotes con Vertex Pipelines; almacena los vectores junto con metadatos densos; particiona e indexa de forma inteligente (p. ej., por dominio del documento) para acotar la latencia.
Canalizaciones de generación aumentada por recuperación (RAG):
- Ingiere contenido a través de Dataflow o Dataproc, extrae texto, divídelo en fragmentos (chunking), crea embeddings e indéxalo en un almacén de vectores. Mantén referencias a la fuente de verdad (source-of-truth) para la trazabilidad.
- Implementa estrategias de actualización (freshness): re-embedding periódico, invalidación tras actualizaciones en la fuente y canary indexing para validar la calidad antes de intercambiar los índices.
- Supervisa la calidad de la recuperación (tasa de aciertos, MRR, nDCG) y la seguridad del contenido; aplica barreras de protección (guardrails) y controles de acceso para datos restringidos.
Capas de servicio de análisis y productos de datos:
- Cura productos de datos de tipo bronce/plata/oro en BigQuery; usa particionamiento y clustering para minimizar los costos de escaneo. Las vistas materializadas pueden acelerar las consultas comunes.
- Para contadores de clave-valor de baja latencia o con un alto QPS, usa Bigtable con claves de fila bien distribuidas; evita el hot-spotting mediante la adición de sal (salting) o el hashing de prefijos.
- Para cargas de trabajo OLTP y consistencia fuerte, usa Cloud SQL o Spanner; descarga el análisis a BigQuery mediante ELT programados.
- Diseño de streaming: Pub/Sub → Dataflow → BigQuery/Bigtable con autoescalado. Supervisa el backlog y las métricas de marca de agua (watermark); el autoescalado predeterminado es suficiente para cargas elásticas mientras se controlan los costos.
Consejo operativo:
- Para activar notificaciones sobre trabajos de inserción específicos en una tabla de BigQuery, exporta las entradas relevantes de Cloud Logging a Pub/Sub usando un filtro avanzado, y luego conecta alertas desde la suscripción:
undefined
Escenario de un Problema Práctico
AcmeStyle, un marketplace de moda, quiere mantener actualizadas las recomendaciones en su sitio a medida que las preferencias de los usuarios cambian cada hora. Transmiten en tiempo real el comportamiento de clics y compras y necesitan combinar esto con el contexto del catálogo para actualizar las recomendaciones con baja latencia y un costo controlado.
Enfoque:
- Ingesta de stream y controles de calidad
- Usar Pub/Sub para la ingesta de eventos desde la web y los dispositivos móviles. Un trabajo de streaming de Dataflow valida los esquemas, enriquece con datos del catálogo y escribe:
- Eventos limpios en tablas particionadas de BigQuery (event_date) para análisis offline y entrenamiento.
- Actualizaciones agregadas de características de usuario en Vertex AI Feature Store (almacén en línea) con user_id como clave. Justificación: Pub/Sub desacopla a los productores y consumidores; Dataflow proporciona semántica de procesamiento único (exactly-once) con operaciones de inserción/actualización (upserts) idempotentes; BigQuery particionado gestiona el costo y la retención; el almacén en línea permite búsquedas en milisegundos.
- Definiciones de características con corrección en un punto en el tiempo (point-in-time)
- Definir características como el CTR móvil, la afinidad con la marca y la recencia con un event_time explícito. Materializar en:
- Almacén offline en BigQuery para entrenamiento con uniones temporales restringidas a feature_ts <= label_ts.
- Almacén en línea para el servicio con TTL para evitar valores obsoletos. Justificación: Las marcas de tiempo claras evitan la fuga de etiquetas (label leakage); las definiciones consistentes entre el entorno offline y el online aseguran la paridad entre entrenamiento y servicio.
- Entrenamiento del modelo y linaje
- Implementar una Vertex AI Pipeline que:
- Extraiga datos de entrenamiento de BigQuery usando ventanas de tiempo (p. ej., los últimos 30 días).
- Aplique las mismas transformaciones usadas en el servicio (biblioteca compartida).
- Entrene un modelo de clasificación (ranking); registre metadatos (ID de las instantáneas del conjunto de datos, SHA de los commits de código, hiperparámetros) en ML Metadata y registre el modelo en el Model Registry. Justificación: Las canalizaciones hacen que las ejecuciones sean reproducibles y auditables; Model Registry centraliza las versiones y aprobaciones.
- Rutas de predicción por lotes y en línea
- Predicciones nocturnas por lotes que puntúan la matriz completa de catálogo-usuario en BigQuery para relleno de datos históricos (backfill) y pruebas A/B.
- Predicciones en línea a través de un endpoint de Vertex que:
- Obtiene características de usuario actualizadas del almacén en línea.
- Puntúa los K mejores candidatos filtrados por inventario y disponibilidad.
- Almacena en caché los resultados por períodos cortos para absorber picos de tráfico. Justificación: El procesamiento por lotes proporciona amplitud y eficiencia de costos; el procesamiento en línea captura el comportamiento más reciente para sesiones de alto valor. Los endpoints con autoescalado mantienen los SLO de latencia; el almacenamiento en caché reduce la latencia de cola y el costo.
- Supervisión, detección de deriva (drift) y política de reentrenamiento
- Habilitar la supervisión del modelo para la deriva de características (feature drift) y el sesgo en las predicciones (prediction skew); comparar las distribuciones con las líneas de base del entrenamiento. Rastrear los SLO de CTR/CVR y alertar en caso de degradación.
- Reentrenar continuamente usando una ventana móvil que combine datos históricos y nuevos; activar el reentrenamiento cuando la deriva exceda los umbrales o, como mínimo, semanalmente. Justificación: Las tendencias de la moda cambian rápidamente; combinar el historial con señales recientes estabiliza el aprendizaje mientras se mantiene actualizado.
- Privacidad y gobernanza
- Etiquetar columnas con PII (información de identificación personal) con etiquetas de políticas de Data Catalog; aplicar seguridad a nivel de columna en BigQuery y enmascarar donde sea necesario. Ejecutar escaneos de DLP en eventos sin procesar; almacenar solo los campos necesarios.
- Requerir aprobación humana para promover modelos del entorno de staging a producción a través de activadores de Cloud Build integrados con los estados de aprobación de Model Registry. Justificación: El acceso con privilegios mínimos reduce el riesgo; controlar los despliegues asegura el cumplimiento y la seguridad.
- Controles de costo y capacidad
- Usar reservas de BigQuery para garantizar una capacidad de slots predecible para las ventanas de entrenamiento.
- Escalar los workers de Dataflow automáticamente según el backlog; fragmentar (shard) las claves con mucho tráfico en el almacén de características aplicando hashing a los prefijos de user_id para prevenir el hot-spotting. Justificación: La capacidad predecible evita la contención; el autoescalado ajusta el gasto a la demanda; las claves balanceadas mantienen las actualizaciones con baja latencia.
Este diseño mantiene las recomendaciones actualizadas al unificar características de streaming para el servicio con un reentrenamiento regular sobre datos recientes, a la vez que mantiene la corrección, la gobernanza y un rendimiento predecible a escala.
← Orquestación de Flujos de Trabajo y Automatización de Canalizaciones · Todos los dominios · Gobernanza de Datos →
Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Aprueba tu examen →