Amazon DEA-C01: Przechowywanie danych i architektura jeziora danych — Przewodnik do nauki

Część Amazon Data Engineer Associate DEA-C01 — Przewodnik do nauki. Ćwicz ze zweryfikowanymi odpowiedziami w centrum egzaminów Amazon, albo rozwiąż testy na czas na ExamRoll.io.

Ta domena obejmuje sposób, w jaki usługi przechowywania i silniki baz danych AWS wspierają pozyskiwanie danych na dużą skalę, trwałą archiwizację, wydajność zapytań i bezpieczne zarządzanie w nowoczesnych platformach danych. Inżynierowie danych muszą równoważyć koszty, opóźnienia w dostępie, trwałość i szczegółową kontrolę dostępu podczas integracji usług takich jak S3, Lake Formation, Redshift i DynamoDB z potokami danych. Zrozumienie kompromisów między klasami pamięci masowej, automatyzacji cyklu życia, pamięci zarządzanej w porównaniu z lokalną oraz wzorców partycjonowania zapobiega niespodziankom związanym z wydajnością i kosztami w środowisku produkcyjnym.

Klasy pamięci masowej Amazon S3 i polityki cyklu życia

S3 oferuje wiele klas pamięci masowej i mechanizmów kontroli cyklu życia w celu optymalizacji kosztów i wzorców dostępu. Skonfiguruj klasę pamięci masowej podczas przesyłania (w konsoli lub przez CLI: aws s3 cp file s3://bucket/key –storage-class INTELLIGENT_TIERING) lub użyj reguł cyklu życia bucketu (aws s3api put-bucket-lifecycle-configuration –bucket my-bucket –lifecycle-configuration file://lifecycle.json). Intelligent-Tiering automatycznie przenosi obiekty między warstwami o częstym i rzadkim dostępie i wiąże się z niewielką opłatą za monitorowanie; włącz tę opcję dla nieznanych lub zmieniających się wzorców dostępu. Użyj reguł cyklu życia, aby przenosić obiekty do GLACIER lub DEEP_ARCHIVE w celu długoterminowego przechowywania oraz aby wygaszać/usuwać stare wersje.

Kryteria decyzyjne i kompromisy:

Uwagi operacyjne:

Projektowanie data lake z S3 i Lake Formation

Zaprojektuj data lake z S3 jako centralnym magazynem obiektów i Lake Formation do scentralizowanej kontroli dostępu i katalogowania. Zarejestruj lokalizacje S3 jako zasoby Lake Formation, skonfiguruj AWS Glue Data Catalog i użyj uprawnień Lake Formation dla baz danych/tabel (aws lakeformation grant-permissions –principal arn:aws:iam::123456789012:user/analyst –permissions SELECT –resource ‘{…}’). Lake Formation może wymuszać szczegółowe kontrole: na poziomie kolumn, na poziomie wierszy (wyrażenia filtrujące) i maskowanie na poziomie komórek przy użyciu LF-tags i filtrów danych stosowanych do zapytań Glue/Athena.

Kluczowe wzorce konfiguracji i zarządzania:

Punkty decyzyjne:

Architektura i przechowywanie danych w Amazon Redshift

Redshift oddziela moc obliczeniową i zarządzaną pamięć masową w węzłach RA3 od lokalnej pamięci masowej w węzłach DS2 opartych na dyskach SSD. Węzły RA3 używają Redshift Managed Storage (RMS), gdzie dane rezydują w Amazon S3 zarządzanym przez klaster; wybierz RA3 dla skalowalnej pamięci masowej ze stałą wydajnością zapytań i możliwością płacenia za moc obliczeniową oddzielnie. Węzły DS2 przechowują dane na dyskach lokalnych instancji, co wymaga starannego doboru rozmiaru i jego zmiany w miarę wzrostu ilości danych.

Szczegóły konfiguracji i operacji:

Porównanie (RA3 vs DS2):

DynamoDB i wybór specjalizowanych baz danych

Wybierz DynamoDB dla obciążeń typu klucz-wartość i dokumentowych o dużej skali, wymagających opóźnień rzędu pojedynczych milisekund. Projekt tabeli zależy od wyboru klucza partycji (i opcjonalnego klucza sortowania): używaj kluczy o wysokiej kardynalności i dobrym rozkładzie, aby unikać gorących partycji (hot partitions). Dla kluczy sekwencyjnych lub opartych na znacznikach czasu zaimplementuj losowe prefiksy (sharding) lub użyj identyfikatorów UUID, aby rozproszyć operacje zapisu. Używaj pojemności na żądanie (on-demand), aby uniknąć provisioningu, ale rozważ pojemność provisionowaną z autoskalowaniem dla przewidywalnych obciążeń i aby wykorzystać pojemność adaptacyjną (adaptive capacity) na gorących partycjach.

Praktyczne uwagi dotyczące konfiguracji:

undefined

.

Kryteria wyboru silnika bazodanowego:

Częste pułapki i kryteria decyzyjne

Problem praktyczny: Scenariusz użycia

Firma Acme Media musi przechowywać 50 TB surowych danych wideo, zapewniać analitykom dostęp do zapytań do przetworzonych metadanych oraz wymuszać dostęp na poziomie wierszy i kolumn dla różnych jednostek biznesowych, minimalizując jednocześnie koszty przechowywania.

  1. Przesyłaj surowe wideo do S3 za pomocą multipart upload, taguj obiekty według daty pozyskania i zestawu danych, użyj Intelligent-Tiering dla początkowych, nieznanych wzorców dostępu.
  2. Skonfiguruj reguły cyklu życia, aby przenosić media do GLACIER lub DEEP_ARCHIVE po konfigurowalnym okresie retencji (upewnij się, że jest on zgodny z minimum 30 dniami dla Standard-IA, jeśli ta klasa jest brana pod uwagę).
  3. Zarejestruj lokalizacje S3 w Lake Formation, zbuduj crawlery Glue, aby wypełnić Data Catalog, i nadaj uprawnienia na poziomie wierszy i kolumn oparte na tagach LF dla jednostek biznesowych.
  4. Przechowuj przetworzone metadane w Redshift RA3 do celów analitycznych; przypisz rolę IAM do klastra dla operacji COPY z S3 i używaj operacji VACUUM/ANALYZE w oknach konserwacyjnych.
  5. Użyj DynamoDB z haszowanymi kluczami UUID dla tabeli przeglądowej manifestów wideo o wysokiej przepustowości i włącz pojemność na żądanie (on-demand), aby absorbować skoki ruchu.

Uzasadnienie: Takie podejście izoluje koszty przechowywania zimnych danych dzięki klasom Glacier, wykorzystuje Intelligent-Tiering dla nieznanych wzorców, stosuje Lake Formation do bezpiecznej, szczegółowej kontroli dostępu w różnych silnikach analitycznych i wybiera RA3 dla skalowalnego przechowywania danych analitycznych, podczas gdy DynamoDB obsługuje operacyjne wyszukiwania o niskim opóźnieniu.


Ingestia i gromadzenie danych · Wszystkie domeny · Katalogowanie danych i zarządzanie metadanymi

Przećwicz te pytania → · Testy na czas na ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Zdaj egzamin →

Przeglądaj Amazon →

Related guides

Dostęp all-in-one

Jedna subskrypcja. Każdy egzamin.

Każdy plan odblokowuje nieograniczone wyszukiwanie odpowiedzi, testy praktyczne, wyjaśnienia AI i pełną bibliotekę zasobów — w ponad 20 językach.

Miesięczny
24.87
Just €0.83/day
Wszystko w cenie:
  • Nieograniczone wyszukiwanie odpowiedzi
  • Nieograniczone testy praktyczne
  • Wyjaśnienia wspomagane AI
  • Pełna biblioteka zasobów
  • Ponad 20 języków
  • Cotygodniowe aktualizacje treści
  • Nagrody i polecenia
  • Priorytetowe wsparcie
Rozpocznij bezpłatny okres próbny

Karta kredytowa nie jest wymagana*

Najlepsza wartość
12 miesięcy
179.87
Just €0.49/daySave 40%
Wszystko w cenie:
  • Nieograniczone wyszukiwanie odpowiedzi
  • Nieograniczone testy praktyczne
  • Wyjaśnienia wspomagane AI
  • Pełna biblioteka zasobów
  • Ponad 20 języków
  • Cotygodniowe aktualizacje treści
  • Nagrody i polecenia
  • Priorytetowe wsparcie
Rozpocznij bezpłatny okres próbny

Karta kredytowa nie jest wymagana*

✓ Plan darmowy w zestawie · ✓ Anuluj w dowolnym momencie · ✓ Wszystkie plany odblokowują pełny produkt