Google PDE: Gouvernance des données, sécurité, fiabilité et gestion opérationnelle des coûts — Guide d'étude

Fait partie du Google Professional Data Engineer — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Google, ou passez des tests chronométrés sur ExamRoll.io.

Vue d’ensemble

Cette section résume les modèles de conception et les pratiques opérationnelles pour la gouvernance des données, la sécurité, la fiabilité et les opérations de coûts sur Google Cloud. Elle se concentre sur BigQuery, Cloud Storage, Dataflow, Dataplex et les services associés. L’accent est mis sur le moindre privilège, la gestion des clés de chiffrement, les métadonnées et la classification, l’accès basé sur des politiques, les preuves de conformité, l’observabilité avec des SLO exploitables et le contrôle des coûts. Les compromis, les modes de défaillance et les configurations pratiques sont inclus pour permettre des plateformes de données sûres, auditables et efficaces.

Identité, Accès et Gouvernance

undefined

undefined

Opérations de sécurité et de conformité

Fiabilité, observabilité, qualité et gestion des coûts

Scénario de problème pratique

NovaRetail Analytics s’associe à plusieurs marques pour ingérer quotidiennement des fichiers CSV contenant des données de transaction dans une plateforme d’analyse partagée. Les fichiers arrivent dans un bucket Cloud Storage de réception (landing bucket) et contiennent parfois des lignes mal formées. La plateforme doit appliquer le principe du moindre privilège afin que chaque client ne puisse accéder qu’à ses propres données, détecter les champs sensibles et fournir des alertes immédiates lorsque des lignes sont ajoutées à une table d’audit spécifique. L’entreprise a également besoin de contrôles des coûts et d’un plan de reprise.

Approche :

  1. Isoler les locataires (tenants) et appliquer le moindre privilège

    • Créer un dataset BigQuery dédié par client (par ex., client_a_analytics). N’accorder au groupe du client que les rôles de dataset appropriés (bigquery.dataViewer, bigquery.jobUser) et restreindre l’utilisation de l’API BigQuery aux utilisateurs approuvés via IAM et VPC-SC si applicable.
    • Justification : Un dataset par locataire limite le rayon d’impact (blast radius) et simplifie la complexité des politiques au niveau des lignes (row policy). Le périmètre du moindre privilège au niveau du dataset empêche par défaut l’accès entre locataires.
  2. Gouverner le schéma, la classification et le masquage

    • Définir une taxonomie de tags de politique (policy tag) dans Data Catalog (public, internal, confidential, restricted) et des modèles de tags pour le propriétaire, le data steward et les RTO/RPO. Attacher les tags de politique aux colonnes sensibles (email, card_suffix) dans chaque dataset client. Appliquer des politiques de masquage BigQuery pour restreindre les vues pour les rôles non privilégiés.
    • Exemple :

undefined

.

  1. Découvrir les PII et appliquer la dé-identification si nécessaire

    • Configurer la découverte de Sensitive Data Protection pour analyser le bucket de réception et les tables BigQuery organisées (curated). Utiliser un modèle d’inspection pour les PII courantes et un modèle de dé-identification pour tokeniser les e-mails de manière déterministe pour les cas d’usage de jointure.
    • Justification : La découverte automatisée réduit les erreurs manuelles ; la tokenisation déterministe équilibre la confidentialité avec les exigences de jointure pour l’analyse.
  2. Sécuriser le pipeline avec des comptes de service, l’emprunt d’identité (impersonation) et les CMEK

    • Utiliser un compte de service Dataflow avec uniquement les rôles nécessaires : storage.objectViewer sur le bucket de réception, bigquery.dataEditor sur les datasets cibles, et l’accès aux tags de politique si requis. Utiliser des CMEK pour les datasets clients et accorder aux agents de service (service agents) de BigQuery et Dataflow le rôle Chiffreur/Déchiffreur de CryptoKey (CryptoKey Encrypter/Decrypter).
    • Justification : Des rôles restreints combinés aux CMEK répondent aux exigences du moindre privilège et du contrôle des clés. L’accès des agents de service aux clés prévient les échecs de jobs.
  3. Construire une ingestion résiliente avec une quarantaine d’erreurs

    • Exécuter un job Dataflow par lots (batch) qui lit les CSV, valide le schéma et écrit les lignes valides dans des tables partitionnées BigQuery. Acheminer les lignes invalides vers une table de lettres mortes (dead-letter) BigQuery avec les détails de l’erreur (nom du fichier, ligne, raison).
    • Justification : Les sorties secondaires (side outputs) conservent les données incorrectes pour analyse sans bloquer les données valides ; les tables partitionnées réduisent les coûts d’analyse et accélèrent les requêtes.
  4. Créer le lignage des données et les métadonnées métier

    • Enregistrer le bucket de réception et les datasets comme des ressources (assets) Dataplex dans un lac de données (lake). Activer la collecte du lignage pour le job Dataflow et taguer les tables organisées avec des métadonnées métier (propriétaire des données, sensibilité, rétention).
    • Justification : La gouvernance centralisée permet l’analyse d’impact, la préparation aux audits et une gestion (stewardship) standardisée.
  5. Surveiller, alerter et auditer

    • Activer les journaux d’audit Admin et Data Access, exportés avec CMEK vers un projet de journalisation central et vers BigQuery pour l’analyse. Ajouter une alerte basée sur les journaux pour les nouvelles lignes ajoutées à la table d’audit en utilisant un filtre avancé sur les jobs d’insertion BigQuery ; exporter ce récepteur (sink) vers Pub/Sub pour que l’outil de surveillance le consomme.
    • Justification : Les journaux sont des preuves infalsifiables ; les alertes ciblées ne notifient que pour la table requ

Machine Learning · Tous les domaines

Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Réussissez votre examen →

Parcourir Google →

Related guides

Accès tout-en-un

Un seul abonnement. Chaque examen.

Chaque plan débloque la recherche de réponses illimitée, les tests pratiques, les explications IA et la bibliothèque complète de ressources — en plus de 20 langues.

Mensuel
24.87
Just €0.83/day
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

Meilleur rapport qualité/prix
12 mois
179.87
Just €0.49/daySave 40%
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

✓ Plan gratuit inclus · ✓ Annulez à tout moment · ✓ Tous les plans débloquent le produit complet