Desea reconstruir una canalización de lotes PySpark lenta utilizando un enfoque sin servidor y basado en SQL. Los datos sin procesar están en Cloud Storage. ¿Cómo debe implementar la canalización para acelerar el desarrollo y el tiempo de ejecución?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Cargue los datos en BigQuery desde Cloud Storage, traduzca las transformaciones de PySpark a BigQuery SQL y escriba los resultados en una nueva tabla de BigQuery..
Por qué esta es la respuesta
La opción correcta aprovecha BigQuery, una solución sin servidor y basada en SQL, para acelerar el desarrollo y el tiempo de ejecución. Al cargar los datos directamente desde Cloud Storage a BigQuery y traducir las transformaciones de PySpark a BigQuery SQL, se elimina la necesidad de gestionar infraestructura (como en Dataproc) y se optimiza el rendimiento para grandes volúmenes de datos. BigQuery está diseñado para análisis rápidos y escalables, lo que lo hace ideal para reemplazar una canalización PySpark lenta. Las otras opciones son menos óptimas: Ejecutar SparkSQL en Dataproc, aunque usa SQL, aún implica gestionar un clúster de Spark, lo que va en contra del objetivo "sin servidor". Ingerir datos en Cloud SQL es ineficiente para grandes volúmenes de datos de lotes y no es una solución sin servidor para el procesamiento principal. Reimplementar con Apache Beam en Python, aunque es una opción sin servidor (con Dataflow), implica reescribir el código en un nuevo SDK, lo que puede no ser tan rápido como traducir a SQL si el objetivo es acelerar el desarrollo con un enfoque SQL.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta