Tiene trabajos Spark on-prem que procesan Parquet diariamente. Al migrar a Google Cloud, desea servicios gestionados, cambios mínimos en ETL y disponibilidad de BigQuery para futuras canalizaciones. ¿Qué debería hacer?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Migrar los datos a Cloud Storage y la metadata a Dataproc Metastore (DPMS). Refactorizar los trabajos Spark para leer/escribir en Cloud Storage y ejecutarlos en Dataproc Serverless..
Por qué esta es la respuesta
La opción correcta es la más adecuada porque Dataproc Serverless permite ejecutar trabajos Spark sin gestionar infraestructura, cumpliendo el requisito de servicio gestionado. Migrar los datos a Cloud Storage es el primer paso lógico para la nube, y refactorizar los trabajos Spark para leer/escribir en Cloud Storage es un cambio mínimo en el ETL. Dataproc Metastore (DPMS) es esencial para gestionar la metadata de Parquet, manteniendo la compatibilidad con los trabajos Spark existentes y facilitando la integración con BigQuery para futuras canalizaciones. Las otras opciones son menos óptimas: Registrar el bucket en Dataplex es útil para la gobernanza de datos, pero no reemplaza la necesidad de un metastore para los trabajos Spark. Migrar los datos directamente a BigQuery requeriría una refactorización significativa de los trabajos Spark para adaptarse al modelo de BigQuery, lo que va en contra del requisito de "cambios mínimos en ETL". BigLake no es un destino de almacenamiento primario para la migración de datos, sino una capa de acceso. Ejecutar Dataproc en Compute Engine no es un servicio completamente gestionado como Dataproc Serverless.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta