Amazon DEA-C01: Ingestia i gromadzenie danych — Przewodnik do nauki

Część Amazon Data Engineer Associate DEA-C01 — Przewodnik do nauki. Ćwicz ze zweryfikowanymi odpowiedziami w centrum egzaminów Amazon, albo rozwiąż testy na czas na ExamRoll.io.

Wzorce pozyskiwania danych oparte na API i zdarzeniach

API i zdarzenia służą do pozyskiwania danych w modelu push oraz do orkiestracji. Typowe wzorce:

Kwestie operacyjne i wzorce CLI:

Częste pułapki i kryteria decyzyjne

Problem praktyczny: Scenariusz użycia

Firma RetailCo zbiera strumienie kliknięć z aplikacji mobilnych (duży wolumen, czas rzeczywisty) oraz nocne pliki z katalogiem produktów; potrzebuje dashboardów w czasie rzeczywistym i skonsolidowanego jeziora danych analitycznych (analytics lake).

  1. Pozyskuj strumienie kliknięć do Kinesis Data Streams, używając kluczy partycji utworzonych z sesji użytkownika + haszowanego sufiksu sharda; twórz konsumentów za pomocą Kinesis Data Analytics lub Lambda/Kinesis Client Library do przetwarzania w czasie rzeczywistym.
  2. Użyj Kinesis Data Firehose z transformującą funkcją Lambda, aby zapisywać wzbogacone dane strumieniowe w S3 (format Parquet), kompresować za pomocą Snappy i opcjonalnie ładować do Redshift Spectrum w celach analitycznych.
  3. Umieszczaj nocne pliki katalogowe w S3 w ścieżce raw/ i uruchamiaj zaplanowany crawler Glue, aby zaktualizować Glue Data Catalog, a następnie uruchamiaj zadania Glue ETL, aby przekonwertować dane na partycjonowany format Parquet w strefie przetworzonej (curated zone).
  4. Użyj powiadomień o zdarzeniach S3 -> SNS -> Lambda, aby wyzwalać lekkie aktualizacje metadanych lub unieważniać pamięć podręczną (cache); przekieruj dostarczanie do SQS w celu zapewnienia trwałego przetwarzania w dalszych etapach.
  5. Monitoruj metryki shardów Kinesis (IncomingBytes, IncomingRecords, PutRecords.Success) i używaj UpdateShardCount lub strumieni On-Demand, aby radzić sobie ze wzrostem obciążenia; włącz alarmy CloudWatch.

Uzasadnienie zgodne z najlepszymi praktykami AWS: oddziel ścieżki przetwarzania danych w czasie rzeczywistym i wsadowych, używaj Kinesis Data Streams, gdy wymagane jest odtwarzanie danych i izolacja konsumentów, używaj Firehose do zarządzanego dostarczania danych do S3/innych miejsc docelowych oraz utrzymuj Glue Data Catalog w celu odnajdywania danych i integracji zapytań z Athena/Redshift.


Wszystkie domeny · Przechowywanie danych i architektura jeziora danych

Przećwicz te pytania → · Testy na czas na ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Zdaj egzamin →

Przeglądaj Amazon →

Related guides

Dostęp all-in-one

Jedna subskrypcja. Każdy egzamin.

Każdy plan odblokowuje nieograniczone wyszukiwanie odpowiedzi, testy praktyczne, wyjaśnienia AI i pełną bibliotekę zasobów — w ponad 20 językach.

Miesięczny
24.87
Just €0.83/day
Wszystko w cenie:
  • Nieograniczone wyszukiwanie odpowiedzi
  • Nieograniczone testy praktyczne
  • Wyjaśnienia wspomagane AI
  • Pełna biblioteka zasobów
  • Ponad 20 języków
  • Cotygodniowe aktualizacje treści
  • Nagrody i polecenia
  • Priorytetowe wsparcie
Rozpocznij bezpłatny okres próbny

Karta kredytowa nie jest wymagana*

Najlepsza wartość
12 miesięcy
179.87
Just €0.49/daySave 40%
Wszystko w cenie:
  • Nieograniczone wyszukiwanie odpowiedzi
  • Nieograniczone testy praktyczne
  • Wyjaśnienia wspomagane AI
  • Pełna biblioteka zasobów
  • Ponad 20 języków
  • Cotygodniowe aktualizacje treści
  • Nagrody i polecenia
  • Priorytetowe wsparcie
Rozpocznij bezpłatny okres próbny

Karta kredytowa nie jest wymagana*

✓ Plan darmowy w zestawie · ✓ Anuluj w dowolnym momencie · ✓ Wszystkie plany odblokowują pełny produkt