Vous souhaitez reconstruire un pipeline de traitement par lots PySpark lent en utilisant une approche serverless basée sur SQL. Les données brutes se trouvent dans Cloud Storage. Comment devriez-vous implémenter le pipeline pour accélérer le développement et l'exécution ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Charger les données dans BigQuery depuis Cloud Storage, traduire les transformations PySpark en BigQuery SQL et écrire les résultats dans une nouvelle table BigQuery..
Pourquoi c'est la réponse
La bonne approche pour un pipeline serverless basé sur SQL est de charger les données brutes de Cloud Storage directement dans BigQuery. BigQuery est un entrepôt de données serverless et hautement évolutif qui prend en charge SQL standard, ce qui permet de traduire facilement les transformations PySpark en BigQuery SQL. L'exécution des transformations directement dans BigQuery est optimisée pour la performance et réduit la complexité opérationnelle par rapport à Spark. Les résultats peuvent ensuite être écrits dans une nouvelle table BigQuery pour une consommation ultérieure. Convertir PySpark en SparkSQL sur Dataproc n'est pas serverless. Ingérer les données dans Cloud SQL n'est pas adapté aux grands volumes de données et n'est pas serverless. Réimplémenter avec Apache Beam est une approche serverless, mais elle est basée sur le code (Python) et non sur SQL, ce qui ne répond pas à l'exigence de l'approche "basée sur SQL".
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise