Vous avez besoin d'un pipeline pour copier des données de transactions de séries chronologiques dans BigQuery à des fins d'analyse. La taille initiale de l'ensemble de données est de 1,5 Po, elle augmente de 3 To/jour ; des milliers de transactions sont mises à jour toutes les heures avec un nouveau statut. Les données sont fortement structurées et utilisées pour le ML. Pour maximiser les performances et la convivialité, quelles sont les deux stratégies que vous adoptez ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Dénormaliser les données autant que possible., Développer un pipeline de données où les mises à jour de statut sont ajoutées à BigQuery au lieu d'être mises à jour..
Pourquoi c'est la réponse
La dénormalisation des données est cruciale pour BigQuery afin d'optimiser les performances des requêtes, car elle minimise les jointures coûteuses sur de très grands ensembles de données, ce qui est essentiel pour les charges de travail analytiques et ML. L'ajout de mises à jour de statut comme de nouvelles entrées est préférable aux mises à jour directes car BigQuery est optimisé pour l'ingestion et l'analyse de données en append-only, ce qui est plus efficace que les opérations UPDATE fréquentes sur des tables massives. Préserver la structure des données est généralement inefficace pour BigQuery. Utiliser UPDATE fréquemment est coûteux. Copier un instantané quotidien vers Cloud Storage et l'interroger en tant que source externe serait trop lent et ne répondrait pas aux besoins de données quasi-temps réel.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise