Google PDE: Ład danych, bezpieczeństwo, niezawodność i zarządzanie kosztami — Przewodnik do nauki

Część Google Professional Data Engineer — Przewodnik do nauki. Ćwicz ze zweryfikowanymi odpowiedziami w centrum egzaminów Google, albo rozwiąż testy na czas na ExamRoll.io.

Przegląd

Ta sekcja podsumowuje wzorce projektowe i praktyki operacyjne dotyczące ładu danych, bezpieczeństwa, niezawodności i operacji kosztowych w Google Cloud. Skupia się na usługach BigQuery, Cloud Storage, Dataflow, Dataplex i usługach pomocniczych. Nacisk kładziony jest na zasadę najmniejszych uprawnień, zarządzanie kluczami szyfrowania, metadane i klasyfikację, dostęp oparty na politykach, dowody zgodności, obserwowalność z użytecznymi celami SLO oraz kontrolę kosztów. Uwzględniono kompromisy, tryby awarii i praktyczne konfiguracje, aby umożliwić tworzenie bezpiecznych, audytowalnych i wydajnych platform danych.

Tożsamość, dostęp i ład organizacyjny

Operacje związane z bezpieczeństwem i zgodnością

Niezawodność, obserwowalność, jakość i zarządzanie kosztami

Praktyczny scenariusz problemowy

Firma NovaRetail Analytics współpracuje z wieloma markami, aby codziennie pozyskiwać pliki CSV z danymi transakcyjnymi do współdzielonej platformy analitycznej. Pliki trafiają do docelowego bucketa w Cloud Storage i czasami zawierają nieprawidłowo sformatowane wiersze. Platforma musi egzekwować zasadę najmniejszych uprawnień (least privilege), aby każdy klient miał dostęp tylko do swoich danych, wykrywać pola wrażliwe i dostarczać natychmiastowe alerty, gdy wiersze są dołączane do określonej tabeli audytowej. Firma potrzebuje również kontroli kosztów i planu odzyskiwania danych.

Podejście:

  1. Izoluj najemców (tenants) i egzekwuj zasadę najmniejszych uprawnień

    • Utwórz dedykowany zbiór danych (dataset) BigQuery dla każdego klienta (np. client_a_analytics). Nadaj grupie danego klienta tylko odpowiednie role dla zbioru danych (bigquery.dataViewer, bigquery.jobUser) i ogranicz użycie BigQuery API do zatwierdzonych użytkowników za pomocą IAM i, w stosownych przypadkach, VPC-SC.
    • Uzasadnienie: Zastosowanie jednego zbioru danych na najemcę ogranicza promień rażenia (blast radius) i upraszcza złożoność polityk na poziomie wierszy. Ograniczenie uprawnień na poziomie zbioru danych domyślnie zapobiega dostępowi między najemcami.
  2. Zarządzaj schematem, klasyfikacją i maskowaniem

    • Zdefiniuj taksonomię tagów polityk (policy tag taxonomy) w Data Catalog (public, internal, confidential, restricted) oraz szablony tagów dla właściciela, opiekuna danych (data steward) i RTO/RPO. Dołącz tagi polityk do wrażliwych kolumn (email, card_suffix) w zbiorze danych każdego klienta. Zastosuj polityki maskowania BigQuery, aby ograniczyć widok dla ról bez odpowiednich uprawnień.
    • Przykład: ALTER TABLE client_a_analytics.orders ALTER COLUMN email SET POLICY TAGS ('restricted.pii').
    • Uzasadnienie: Scentralizowane tagi zapewniają jednolitą kontrolę nad wszystkimi tabelami; maskowanie zapewnia domyślne bezpieczeństwo odczytu bez duplikowania danych.
  3. Wykrywaj dane osobowe (PII) i w razie potrzeby wymuszaj deidentyfikację

    • Skonfiguruj wykrywanie (discovery) w Sensitive Data Protection do skanowania docelowego bucketa i wyselekcjonowanych tabel BigQuery. Użyj szablonu inspekcji (inspection template) dla typowych danych PII oraz szablonu deidentyfikacji (de-identification template) do deterministycznej tokenizacji adresów e-mail na potrzeby złączeń (join).
    • Uzasadnienie: Zautomatyzowane wykrywanie redukuje błędy manualne; deterministyczna tokenizacja równoważy prywatność z wymaganiami analitycznymi dotyczącymi złączeń.
  4. Zabezpiecz potok za pomocą kont serwisowych, personifikacji i kluczy CMEK

    • Użyj konta serwisowego Dataflow tylko z niezbędnymi rolami: storage.objectViewer dla docelowego bucketa, bigquery.dataEditor dla docelowych zbiorów danych oraz dostęp do tagów polityk, jeśli jest to wymagane. Użyj kluczy CMEK dla zbiorów danych klientów i nadaj agentom serwisowym BigQuery i Dataflow rolę CryptoKey Encrypter/Decrypter.
    • Uzasadnienie: Wąsko zdefiniowane role w połączeniu z CMEK spełniają wymagania zasady najmniejszych uprawnień i kontroli nad kluczami. Dostęp agentów serwisowych do kluczy zapobiega awariom zadań.
  5. Zbuduj odporny proces pozyskiwania danych z kwarantanną błędów

    • Uruchom zadanie wsadowe (batch) Dataflow, które odczytuje pliki CSV, waliduje schemat i zapisuje prawidłowe wiersze do partycjonowanych tabel BigQuery. Przekieruj nieprawidłowe wiersze do tabeli dead-letter w BigQuery ze szczegółami błędu (nazwa pliku, linia, przyczyna).
    • Uzasadnienie: Wyjścia boczne (side outputs) zachowują błędne dane do analizy, nie blokując przetwarzania poprawnych danych; partycjonowane tabele zmniejszają koszty skanowania i przyspieszają zapytania.
  6. Twórz pochodzenie danych (lineage) i metadane biznesowe

    • Zarejestruj docelowy bucket i zbiory danych jako zasoby (assets) Dataplex w jeziorze danych (lake). Włącz zbieranie pochodzenia danych dla zadania Dataflow i oznacz wyselekcjonowane tabele metadanymi biznesowymi (właściciel danych, wrażliwość, retencja).
    • Uzasadnienie: Scentralizowane zarządzanie (governance) umożliwia analizę wpływu, gotowość do audytu i standaryzację opieki nad danymi.
  7. Monitoruj, alertuj i audytuj

    • Włącz logi audytowe Admin i Data Access, eksportowane z użyciem CMEK do centralnego projektu logowania oraz do BigQuery w celach analitycznych. Dodaj alert oparty na logach dla nowych wierszy dołączanych do tabeli audytowej, używając zaawansowanego filtra dla zadań wstawiania (insert) w BigQuery; wyeksportuj ten sink do Pub/Sub, aby narzędzie monitorujące mogło go przetworzyć.
    • Uzasadnienie: Logi są dowodem odpornym na manipulacje; precyzyjne alerty powiadamiają tylko o wymaganej tabeli, redukując szum informacyjny.
  8. Wprowadź mechanizmy kontroli kosztów i zabezpieczenia zapytań (query guardrails)

    • Wymagaj, aby zadania zapytań ustawiały maximumBytesBilled i wykorzystywały klastrowanie dla kolumn o wysokiej kardynalności (np. order_id). Zastosuj budżety i ustaw etykiety

Uczenie maszynowe · Wszystkie domeny

Przećwicz te pytania → · Testy na czas na ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Zdaj egzamin →

Przeglądaj Google →

Related guides

Dostęp all-in-one

Jedna subskrypcja. Każdy egzamin.

Każdy plan odblokowuje nieograniczone wyszukiwanie odpowiedzi, testy praktyczne, wyjaśnienia AI i pełną bibliotekę zasobów — w ponad 20 językach.

Miesięczny
24.87
Just €0.83/day
Wszystko w cenie:
  • Nieograniczone wyszukiwanie odpowiedzi
  • Nieograniczone testy praktyczne
  • Wyjaśnienia wspomagane AI
  • Pełna biblioteka zasobów
  • Ponad 20 języków
  • Cotygodniowe aktualizacje treści
  • Nagrody i polecenia
  • Priorytetowe wsparcie
Rozpocznij bezpłatny okres próbny

Karta kredytowa nie jest wymagana*

Najlepsza wartość
12 miesięcy
179.87
Just €0.49/daySave 40%
Wszystko w cenie:
  • Nieograniczone wyszukiwanie odpowiedzi
  • Nieograniczone testy praktyczne
  • Wyjaśnienia wspomagane AI
  • Pełna biblioteka zasobów
  • Ponad 20 języków
  • Cotygodniowe aktualizacje treści
  • Nagrody i polecenia
  • Priorytetowe wsparcie
Rozpocznij bezpłatny okres próbny

Karta kredytowa nie jest wymagana*

✓ Plan darmowy w zestawie · ✓ Anuluj w dowolnym momencie · ✓ Wszystkie plany odblokowują pełny produkt