Google PDE: Stockage des données, lacs de données et formats de fichiers — Guide d'étude

Fait partie du Google Professional Data Engineer — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Google, ou passez des tests chronométrés sur ExamRoll.io.

Vue d’ensemble

Le stockage de données sur Google Cloud couvre le stockage d’objets bruts, les lacs de données organisés (curated) et les formats optimisés pour l’analytique. La construction de lacs de données fiables, gouvernés et performants exige des choix judicieux en matière de classes de stockage, de paramètres de buckets, d’emplacements, de formats de fichiers, de structure de table et de cycle de vie. Cette section détaille les compromis de conception, les modes de défaillance à éviter et les modèles qui s’alignent avec BigQuery, Spark et les pipelines de streaming à grande échelle.

Fondations de Cloud Storage : classes, buckets, cohérence et cycle de vie

Cloud Storage est la fondation durable et hautement disponible pour les fichiers bruts et organisés.

Gouvernance unifiée du lac de données avec BigLake et Dataplex

BigLake et Dataplex standardisent la sécurité et la gouvernance sur les fichiers et les tables.

Formats de fichiers, compression et comportement des requêtes

Le choix du bon format a des effets de premier ordre sur les coûts et les performances.

Structure, partitionnement, ingénierie de la performance, résidence des données et migration

undefined

Scénario de problème pratique

Acme Retail reçoit quotidiennement des fichiers CSV d’un partenaire logistique dans un bucket Cloud Storage régional. Les fichiers contiennent occasionnellement des lignes malformées. Acme doit réceptionner, valider, convertir dans un format prêt pour l’analytique et charger dans BigQuery pour des tableaux de bord en quasi-temps réel, tout en conservant les lignes incorrectes pour inspection et en appliquant la gouvernance.

Approche :

  1. Réceptionner et gouverner les données brutes dans Dataplex

    • Créer un lac Dataplex avec un asset de zone brute (raw zone) mappé sur gs://acme-raw/logistics/.
    • Justification : Gouvernance, métadonnées et lignage des données centralisés. Appliquer l’IAM au niveau de la zone et marquer les champs sensibles avec des policy tags pour une application en aval.
  2. Appliquer le cycle de vie et la rétention

    • Appliquer une politique de rétention de 30 jours sur le bucket et activer le versioning des objets sur acme-raw.
    • Justification : Protège contre l’écrasement/la suppression accidentels par le partenaire ; une rétention courte équilibre le coût et la capacité de récupération. Le versioning facilite l’annulation (rollback) des livraisons défectueuses.
  3. Valider et ingérer avec un pipeline de traitement par lots (batch) Dataflow

    • Déclencher une tâche Dataflow quotidienne sur les notifications de finalisation d’objet. Lire le CSV avec un schéma et une validation par enregistrement ; écrire les enregistrements valides dans une table de pré-production (staging) BigQuery (partitionnée par event_date) et router les erreurs d’analyse/validation vers une table de rebut (dead-letter) BigQuery.
    • Justification : Dataflow fournit une analyse syntaxique parallèle et évolutive ainsi qu’une gestion robuste des rebuts, afin que les analystes puissent inspecter les lignes incorrectes. Cela reflète les meilleures pratiques pour une qualité de CSV hétérogène.
  4. Compacter et convertir en Parquet dans une zone organisée (curated zone)

    • Le même pipeline écrit les données validées dans gs://acme-curated/logistics/date=YYYY-MM-DD/ sous forme de fichiers Parquet d’une taille d’environ 256 à 512 Mo.
    • Justification : Parquet permet l’élagage de colonnes (column pruning) et la délégation de prédicats (predicate pushdown) dans BigQuery et Spark, ce qui réduit les octets analysés et améliore la latence ; le compactage atténue la surcharge liée aux petits fichiers provenant du mode de livraison du partenaire.
  5. Exposer l’analytique gouvernée via BigLake

    • Créer une table externe BigLake sur le chemin Parquet organisé avec l’auto-partitionnement Hive ; appliquer des policy tags au niveau des colonnes et des politiques d’accès aux lignes pour les filtres spécifiques au partenaire.
    • Justification : Accès uniforme et affiné sur BigQuery et Spark avec un audit centralisé. L’élagage de partition (partition pruning) réduit les coûts d’analyse sur les filtres de date.
  6. Charger les agrégats critiques dans une table native BigQuery

    • Pour les tableaux de bord à forte sollicitation (hot), exécuter une tâche BigQuery planifiée qui ingère les N derniers jours depuis la table externe Parquet organisée vers une table native partitionnée et clusterisée.
    • Justification : Le stockage natif accélère la BI à haute concurrence tandis que la table externe BigLake reste le système de référence (system-of-record) gouverné pour un accès plus large.
  7. Surveiller et alerter avec Cloud Logging et Pub/Sub

    • Créer un récepteur de journaux (log sink) filtrant les résultats des tâches de chargement Dataflow et BigQuery vers Pub/Sub ; intégrer avec l’outil de surveillance pour des alertes instantanées sur les échecs ou les taux élevés de lignes incorrectes.
    • Justification : Visibilité opérationnelle ciblée et spécifique à la table sans interrogation active (polling) ; prend en charge les pratiques SRE.
  8. Optimiser la classe de stockage et la résidence des données

    • Conserver le Parquet organisé en classe Standard pendant 14 jours, puis passer en Coldline après 30 jours via une règle de cycle de vie ; stocker les buckets bruts et organisés dans la même région que les datasets BigQuery pour éviter l’egress.
    • Justification : Équilibre les performances de lecture à chaud avec le coût. La colocalisation maintient la conformité et minimise la latence et les frais d’egress.
  9. Valider la qualité de bout en bout

    • Après chaque exécution, comparer les décomptes et les agrégats de hachage entre les tables de staging, externe organisée et native BigQuery ; mettre en quarantaine les anomalies.
    • Justification : Détection précoce de la dérive de schéma ou des régressions d’ingestion ; les hachages cryptographiques ou par empreinte (fingerprint) fournissent une assurance légère sans nécessiter de nouvelles analyses complètes.

Cette conception fournit une ingestion résiliente avec analyse des rebuts, un format Parquet prêt pour l’analytique pour des requêtes efficaces, une gouvernance centralisée via Dataplex et BigLake, et des politiques de cycle de vie optimisées en termes de coûts, tout en respectant le principe du moindre privilège et en garantissant des opérations auditables.


Architecture et conception de l’ingénierie des données · Tous les domaines · Analytique BigQuery et ingénierie d’entrepôt de données

Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Réussissez votre examen →

Parcourir Google →

Related guides

Accès tout-en-un

Un seul abonnement. Chaque examen.

Chaque plan débloque la recherche de réponses illimitée, les tests pratiques, les explications IA et la bibliothèque complète de ressources — en plus de 20 langues.

Mensuel
24.87
Just €0.83/day
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

Meilleur rapport qualité/prix
12 mois
179.87
Just €0.49/daySave 40%
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

✓ Plan gratuit inclus · ✓ Annulez à tout moment · ✓ Tous les plans débloquent le produit complet