Google PDE: Przechowywanie danych, jeziora danych i formaty plików — Przewodnik do nauki

Część Google Professional Data Engineer — Przewodnik do nauki. Ćwicz ze zweryfikowanymi odpowiedziami w centrum egzaminów Google, albo rozwiąż testy na czas na ExamRoll.io.

Przegląd

Przechowywanie danych w Google Cloud obejmuje surową pamięć masową obiektów, uporządkowane jeziora danych i formaty zoptymalizowane pod kątem analityki. Budowa niezawodnych, zarządzanych i wydajnych jezior danych wymaga starannego doboru klas pamięci masowej, ustawień bucketów, lokalizacji, formatów plików, układu tabel i cyklu życia. Ta sekcja szczegółowo omawia kompromisy projektowe, tryby awarii, których należy unikać, oraz wzorce, które sprawdzają się w przypadku BigQuery, Spark i potoków strumieniowych działających na dużą skalę.

Podstawy Cloud Storage: klasy, buckety, spójność i cykl życia

Cloud Storage to trwała i wysoce dostępna podstawa dla surowych i uporządkowanych plików.

undefined

Ujednolicone zarządzanie jeziorem danych za pomocą BigLake i Dataplex

BigLake i Dataplex standaryzują bezpieczeństwo i zarządzanie (governance) plikami i tabelami.

Formaty plików, kompresja i zachowanie zapytań

Wybór odpowiedniego formatu ma bezpośredni wpływ na koszty i wydajność.

Układ, partycjonowanie, inżynieria wydajności, rezydencja i migracja

undefined

Praktyczny scenariusz problemowy

Firma Acme Retail otrzymuje codzienne zrzuty plików CSV od partnera logistycznego do regionalnego bucketa Cloud Storage. Pliki czasami zawierają niepoprawnie sformatowane wiersze. Acme musi umieścić dane, zwalidować je, przekonwertować do formatu gotowego do analizy i załadować do BigQuery dla pulpitów nawigacyjnych działających w czasie zbliżonym do rzeczywistego, jednocześnie zachowując błędne wiersze do inspekcji i egzekwując ład danych (governance).

Podejście:

  1. Umieszczanie i zarządzanie surowymi danymi w Dataplex

    • Utwórz Dataplex lake z zasobem strefy surowej (raw zone) zmapowanym na gs://acme-raw/logistics/.
    • Uzasadnienie: Scentralizowany ład danych, metadane i pochodzenie danych (lineage). Wymuszaj polityki IAM na poziomie strefy i oznaczaj wrażliwe pola tagami polityk (policy tags) do egzekwowania w systemach podrzędnych.
  2. Wymuszanie cyklu życia i retencji

    • Zastosuj politykę retencji bucketa na 30 dni i włącz wersjonowanie obiektów w acme-raw.
    • Uzasadnienie: Chroni przed przypadkowym nadpisaniem/usunięciem przez partnera; krótka retencja równoważy koszt i możliwość odtworzenia danych. Wersjonowanie ułatwia wycofanie błędnych dostaw.
  3. Walidacja i pozyskiwanie za pomocą potoku wsadowego Dataflow

    • Uruchamiaj codzienne zadanie Dataflow na podstawie powiadomień o finalizacji obiektu. Odczytuj pliki CSV ze schematem i walidacją per rekord; zapisuj poprawne rekordy do przejściowej tabeli BigQuery (staging) (partycjonowanej według event_date) i przekierowuj błędy parsowania/walidacji do tabeli BigQuery na odrzucone komunikaty (dead-letter).
    • Uzasadnienie: Dataflow zapewnia skalowalne, równoległe parsowanie i solidną obsługę odrzuconych rekordów, dzięki czemu analitycy mogą je sprawdzać. Odzwierciedla to najlepsze praktyki dla niejednorodnej jakości plików CSV.
  4. Kompakcja i konwersja do formatu Parquet w strefie przetworzonej (curated zone)

    • Ten sam potok zapisuje zwalidowane dane do gs://acme-curated/logistics/date=YYYY-MM-DD/ jako pliki Parquet o rozmiarze ~256–512 MB.
    • Uzasadnienie: Parquet umożliwia przycinanie kolumn (column pruning) i wpychanie predykatów (predicate pushdown) w BigQuery i Spark, zmniejszając liczbę skanowanych bajtów i poprawiając opóźnienia; kompakcja łagodzi narzut związany z małymi plikami wynikający ze sposobu dostarczania danych przez partnera.
  5. Udostępnianie zarządzanych danych analitycznych przez BigLake

    • Utwórz tabelę zewnętrzną BigLake nad ścieżką z przetworzonymi plikami Parquet z automatycznym partycjonowaniem w stylu Hive; zastosuj tagi polityk na poziomie kolumn i polityki dostępu na poziomie wierszy dla filtrów specyficznych dla partnera.
    • Uzasadnienie: Jednolity, szczegółowy dostęp w BigQuery i Spark ze scentralizowanym audytem. Przycinanie partycji (partition pruning) zmniejsza koszty skanowania przy filtrowaniu po dacie.
  6. Ładowanie krytycznych agregatów do natywnej tabeli BigQuery

    • Dla intensywnie używanych pulpitów nawigacyjnych uruchamiaj zaplanowane zadanie BigQuery, które pozyskuje dane z ostatnich N dni z zewnętrznej tabeli Parquet do natywnej, klastrowanej i partycjonowanej tabeli.
    • Uzasadnienie: Natywna pamięć masowa przyspiesza działanie BI o wysokiej współbieżności, podczas gdy zewnętrzna tabela BigLake pozostaje zarządzanym systemem źródłowym (system-of-record) dla szerszego dostępu.
  7. Monitorowanie i alertowanie za pomocą Cloud Logging i Pub/Sub

    • Utwórz ujście logów (log sink) filtrujące wyniki zadań Dataflow i ładowania do BigQuery do Pub/Sub; zintegruj z narzędziem monitorującym, aby otrzymywać natychmiastowe alerty o awariach lub podwyższonym wskaźniku błędnych wierszy.
    • Uzasadnienie: Ukierunkowana, operacyjna widoczność na poziomie tabeli bez odpytywania (polling); wspiera praktyki SRE.
  8. Optymalizacja klasy pamięci masowej i rezydencji

    • Przechowuj przetworzone pliki Parquet w klasie Standard przez 14 dni, a po 30 dniach przenieś do Coldline za pomocą reguły cyklu życia; przechowuj zarówno surowe, jak i przetworzone buckety w tym samym regionie co zbiory danych BigQuery, aby unikać opłat za ruch wychodzący (egress).
    • Uzasadnienie: Równoważy wydajność odczytu gorących danych z kosztem. Kolokacja zapewnia zgodność z regulacjami oraz minimalizuje opóźnienia i opłaty za egress.
  9. Walidacja jakości end-to-end

    • Po każdym uruchomieniu porównuj liczebności i agregaty haszujące między tabelą przejściową, zewnętrzną tabelą przetworzoną a natywną tabelą BigQuery; poddawaj anomalie kwarantannie.
    • Uzasadnienie: Wczesne wykrywanie dryfu schematu lub regresji w procesie pozyskiwania; hasze kryptograficzne lub typu fingerprint zapewniają lekkie zapewnienie jakości bez pełnych ponownych skanów.

Ten projekt zapewnia odporne pozyskiwanie danych z analizą odrzuconych rekordów, gotowy do analizy format Parquet dla wydajnych zapytań, scentralizowany ład danych przez Dataplex i BigLake oraz zoptymalizowane kosztowo polityki cyklu życia, wszystko to przy zachowaniu dostępu zgodnego z zasadą najmniejszych uprawnień i audytowalnych operacji.


Architektura i projektowanie inżynierii danych · Wszystkie domeny · Analityka BigQuery i inżynieria hurtowni danych

Przećwicz te pytania → · Testy na czas na ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Zdaj egzamin →

Przeglądaj Google →

Related guides

Dostęp all-in-one

Jedna subskrypcja. Każdy egzamin.

Każdy plan odblokowuje nieograniczone wyszukiwanie odpowiedzi, testy praktyczne, wyjaśnienia AI i pełną bibliotekę zasobów — w ponad 20 językach.

Miesięczny
24.87
Just €0.83/day
Wszystko w cenie:
  • Nieograniczone wyszukiwanie odpowiedzi
  • Nieograniczone testy praktyczne
  • Wyjaśnienia wspomagane AI
  • Pełna biblioteka zasobów
  • Ponad 20 języków
  • Cotygodniowe aktualizacje treści
  • Nagrody i polecenia
  • Priorytetowe wsparcie
Rozpocznij bezpłatny okres próbny

Karta kredytowa nie jest wymagana*

Najlepsza wartość
12 miesięcy
179.87
Just €0.49/daySave 40%
Wszystko w cenie:
  • Nieograniczone wyszukiwanie odpowiedzi
  • Nieograniczone testy praktyczne
  • Wyjaśnienia wspomagane AI
  • Pełna biblioteka zasobów
  • Ponad 20 języków
  • Cotygodniowe aktualizacje treści
  • Nagrody i polecenia
  • Priorytetowe wsparcie
Rozpocznij bezpłatny okres próbny

Karta kredytowa nie jest wymagana*

✓ Plan darmowy w zestawie · ✓ Anuluj w dowolnym momencie · ✓ Wszystkie plany odblokowują pełny produkt