Google PDE: Data Governance, Sicherheit, Zuverlässigkeit und betriebliches Kostenmanagement — Lernleitfaden

Teil des Google Professional Data Engineer — Lernleitfaden. Üben Sie mit verifizierten Antworten im Google-Prüfungscenter, oder absolvieren Sie zeitlich begrenzte Übungstests auf ExamRoll.io.

Überblick

Dieser Abschnitt fasst Entwurfsmuster und Betriebspraktiken für Data Governance, Sicherheit, Zuverlässigkeit und Kostenmanagement auf Google Cloud zusammen. Er konzentriert sich auf BigQuery, Cloud Storage, Dataflow, Dataplex und unterstützende Dienste. Der Schwerpunkt liegt auf dem Prinzip der geringsten Rechte (Least Privilege), der Verwaltung von Verschlüsselungsschlüsseln, Metadaten und Klassifizierung, richtliniengesteuertem Zugriff, Compliance-Nachweisen, Observability mit umsetzbaren SLOs und Kostenkontrolle. Abwägungen, Fehlermodi und praktische Konfigurationen sind enthalten, um sichere, auditierbare und effiziente Datenplattformen zu ermöglichen.

Identität, Zugriff und Governance

undefined

undefined

Betrieb von Sicherheit und Compliance

Zuverlässigkeit, Beobachtbarkeit, Qualität und Kostenmanagement

undefined

- Reservieren Sie Slots mit BigQuery Reservations für vorhersagbare Workloads; trennen Sie interaktive von Batch-Verarbeitungen durch Zuweisungen

Praktisches Problemszenario

NovaRetail Analytics arbeitet mit mehreren Marken zusammen, um tägliche CSVs mit Transaktionsdaten in eine gemeinsame Analyseplattform aufzunehmen. Die Dateien kommen in einem Cloud Storage Landing Bucket an und enthalten gelegentlich fehlerhafte Zeilen. Die Plattform muss das Prinzip der geringsten Rechte (Least Privilege) durchsetzen, sodass jeder Kunde nur auf seine eigenen Daten zugreifen kann, sensible Felder erkennen und sofortige Benachrichtigungen bereitstellen, wenn Zeilen zu einer bestimmten Audit-Tabelle hinzugefügt werden. Das Unternehmen benötigt außerdem Kostenkontrollen und einen Wiederherstellungsplan.

Ansatz:

  1. Mandanten isolieren und Least Privilege durchsetzen

    • Erstellen Sie ein dediziertes BigQuery-Dataset pro Kunde (z. B. client_a_analytics). Weisen Sie nur der Gruppe des Kunden die entsprechenden Dataset-Rollen (bigquery.dataViewer, bigquery.jobUser) zu und beschränken Sie die Nutzung der BigQuery API auf genehmigte Benutzer über IAM und gegebenenfalls VPC-SC.
    • Begründung: Ein Dataset pro Mandant begrenzt den Explosionsradius (Blast Radius) und vereinfacht die Komplexität von Zeilenrichtlinien. Die Festlegung von geringsten Rechten auf Dataset-Ebene verhindert standardmäßig den mandantenübergreifenden Zugriff.
  2. Schema, Klassifizierung und Maskierung steuern

    • Definieren Sie eine Data Catalog Policy-Tag-Taxonomie (public, internal, confidential, restricted) und Tag-Vorlagen für Owner, Data Steward und RTO/RPO. Hängen Sie Policy Tags an sensible Spalten (email, card_suffix) in jedem Kunden-Dataset an. Wenden Sie BigQuery-Maskierungsrichtlinien an, um die Ansichten für nicht privilegierte Rollen einzuschränken.
    • Beispiel:

undefined

  1. PII erkennen und bei Bedarf De-Identifizierung durchsetzen

    • Konfigurieren Sie die Erkennung von Sensitive Data Protection, um den Landing Bucket und die kuratierten BigQuery-Tabellen zu scannen. Verwenden Sie eine Inspektionsvorlage für gängige PII und eine De-Identifizierungsvorlage, um E-Mails für Join-Anwendungsfälle deterministisch zu tokenisieren.
    • Begründung: Die automatisierte Erkennung reduziert manuelle Fehler; die deterministische Tokenisierung schafft einen Ausgleich zwischen Datenschutz und den Anforderungen von Analyse-Joins.
  2. Pipeline mit Service Accounts, Impersonation und CMEK absichern

    • Verwenden Sie ein Dataflow Service Account nur mit den benötigten Rollen: storage.objectViewer für den Landing Bucket, bigquery.dataEditor für die Ziel-Datasets und gegebenenfalls Zugriff auf Policy Tags. Verwenden Sie CMEK für die Kunden-Datasets und gewähren Sie den BigQuery- und Dataflow-Service-Agents die Rolle CryptoKey Encrypter/Decrypter.
    • Begründung: Eng gefasste Rollen plus CMEK erfüllen die Anforderungen an Least Privilege und Schlüsselkontrolle. Der Zugriff der Service-Agents auf die Schlüssel verhindert Job-Fehler.
  3. Resiliente Datenerfassung mit Fehlerquarantäne aufbauen

    • Führen Sie einen Batch-Dataflow-Job aus, der die CSVs liest, das Schema validiert und gültige Zeilen in partitionierte BigQuery-Tabellen schreibt. Leiten Sie ungültige Zeilen in eine BigQuery-Dead-Letter-Tabelle mit Fehlerdetails (Dateiname, Zeile, Grund) um.
    • Begründung: Seitenausgaben (Side Outputs) bewahren fehlerhafte Daten zur Analyse auf, ohne die Verarbeitung guter Daten zu blockieren; partitionierte Tabellen reduzieren die Scankosten und beschleunigen Abfragen.
  4. Lineage und Geschäftsmetadaten erstellen

    • Registrieren Sie den Landing Bucket und die Datasets als Dataplex-Assets in einem Lake. Aktivieren Sie die Lineage-Erfassung für den Dataflow-Job und versehen Sie kuratierte Tabellen mit Geschäftsmetadaten (Data Owner, Sensitivität, Aufbewahrungsfrist).
    • Begründung: Zentralisierte Governance ermöglicht Auswirkungsanalysen, Audit-Bereitschaft und standardisierte Stewardship.
  5. Überwachen, alarmieren und auditieren

    • Aktivieren Sie Admin- und Data-Access-Audit-Logs, die mit CMEK in ein zentrales Logging-Projekt und zur Analyse nach BigQuery exportiert werden. Fügen Sie eine log-basierte Benachrichtigung für neue Zeilen hinzu, die der Audit-Tabelle angehängt werden, indem Sie einen erweiterten Filter für BigQuery-Insert-Jobs verwenden; exportieren Sie diesen Sink nach Pub/Sub, damit das Monitoring-Tool ihn konsumieren kann.
    • Begründung: Logs sind manipulationssichere Nachweise; gezielte Benachrichtigungen informieren nur über die erforderliche Tabelle und reduzieren so das Rauschen (Noise).
  6. Kostenkontrollen und Abfrage-Leitplanken (Guardrails) durchsetzen

    • Fordern Sie, dass Abfrage-Jobs maximumBytesBilled setzen, und nutzen Sie Clustering für Spalten mit hoher Kardinalität (z. B. order_id). Wenden Sie Budgets an und setzen Sie Labels (client, environment) für Jobs und Datasets. Verwenden Sie BigQuery Reservations, um interaktive Analysen von geplanten Ladevorgängen zu trennen.
    • Begründung: Leitplanken verhindern ausufernde Kosten; Labels ermöglichen die Kostenverrechnung (Chargeback); die Slot-Isolierung sorgt für eine vorhersagbare Leistung.
  7. Aufbewahrung und DR implementieren

    • Aktivieren Sie im Landing Bucket die Objektversionierung und eine Lebenszyklusregel, um Objekte nach 30 Tagen zu löschen; legen Sie eine Aufbewahrungsrichtlinie für Compliance-Zonen fest. Legen Sie in BigQuery eine Standardablaufzeit für Staging-Tabellen fest und erstellen Sie regelmäßig Tabellen-Snapshots von kuratierten Tabellen. Speichern Sie KMS-Backup-Verfahren und Schritte zur Tabellenwiederherstellung in Runbooks und testen Sie diese vierteljährlich.
    • Begründung: Das Lebenszyklusmanagement reduziert die Speicherkosten; Snapshots und dokumentierte Runbooks gewährleisten die Wiederherstellbarkeit. Tests validieren die RTO/RPO-Annahmen.
  8. Regelmäßige Zugriffsüberprüfungen und Qualitäts-SLIs/SLOs

    • Exportieren Sie vierteljährlich IAM-Richtlinien mit Cloud Asset Inventory und vergleichen Sie sie mit einer genehmigten Baseline. Definieren Sie SLOs wie „99 % der täglichen Dateien werden innerhalb von 30 Minuten nach Eingang verarbeitet“ mit Benachrichtigungen zur Burn Rate. Verfolgen Sie Datenqualitäts-SLIs (Vollständigkeit, Gültigkeit) mithilfe von Dataplex Data Quality-Regeln und leiten Sie Verstöße an die Incident Response mit Backfill-Automatisierung weiter.
    • Begründung: Regelmäßige Überprüfungen verhindern eine Ausweitung von Berechtigungen (Privilege Creep); SLO-gesteuerte Abläufe richten den Aufwand an der Benutzererfahrung aus; automatisierte Qualitätsprüfungen erkennen Regressionen frühzeitig.

Behandelte technische Kompromisse und Fehlermodi:


Maschinelles Lernen · Alle Domänen

Diese Fragen üben → · Zeitlich begrenzte Übung auf ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Bestehe deine Prüfung →

Google durchsuchen →

Related guides

All-in-One Zugang

Ein Abonnement. Jede Prüfung.

Jeder Plan schaltet unbegrenzte Antwortsuche, Übungstests, KI-Erklärungen und die vollständige Ressourcenbibliothek frei – in über 20 Sprachen.

Monatlich
24.87
Just €0.83/day
Alles inklusive:
  • Unbegrenzte Antwortsuche
  • Unbegrenzte Übungstests
  • KI-gestützte Erklärungen
  • Vollständige Ressourcenbibliothek
  • Über 20 Sprachen
  • Wöchentliche Inhaltsaktualisierungen
  • Belohnungen & Empfehlungen
  • Priorisierter Support
Kostenlose Testphase starten

Keine Kreditkarte erforderlich*

Bestes Preis-Leistungs-Verhältnis
12 Monate
179.87
Just €0.49/daySave 40%
Alles inklusive:
  • Unbegrenzte Antwortsuche
  • Unbegrenzte Übungstests
  • KI-gestützte Erklärungen
  • Vollständige Ressourcenbibliothek
  • Über 20 Sprachen
  • Wöchentliche Inhaltsaktualisierungen
  • Belohnungen & Empfehlungen
  • Priorisierter Support
Kostenlose Testphase starten

Keine Kreditkarte erforderlich*

✓ Kostenloser Plan enthalten · ✓ Jederzeit kündbar · ✓ Alle Pläne schalten das vollständige Produkt frei