Amazon DEA-C01: Data-ingestie en verzameling — Studiegids

Onderdeel van de Amazon Data Engineer Associate DEA-C01 — Studiegids. Oefen met geverifieerde antwoorden in het Amazon-examencentrum, of doe getimede oefentests op ExamRoll.io.

Dit domein behandelt de patronen, AWS-services en operationele details die worden gebruikt om ruwe data betrouwbaar en op schaal in een dataplatform te brengen. Data engineers moeten kiezen tussen batch- en streaming-ingangspunten, zorgen voor datacatalogisering en vindbaarheid, en ontwerpen voor doorvoer, de mogelijkheid tot opnieuw afspelen en faalscenario’s. De belangrijkste AWS-bouwstenen zijn S3 en Glue voor batch, Kinesis en Firehose voor streaming, DMS voor databasemigratie en CDC, en API/Event-driven componenten (API Gateway, Lambda, SNS, SQS, S3 events) voor ad-hoc en push-gebaseerde opname.

Batch-opname met AWS Glue en S3

Glue is de belangrijkste beheerde ETL- en metadata-oplossing voor batch-opname in S3 en je datacatalogus. Een typisch patroon: plaats ruwe bestanden in S3 (aparte raw/zone-prefixes), voer een Glue-crawler uit om het schema af te leiden en de Glue Data Catalog te vullen, en voer vervolgens Glue ETL-jobs (Spark) uit om te transformeren, partitioneren, converteren naar kolomgeoriënteerde formaten (Parquet/ORC) en geoptimaliseerde data terug te schrijven naar S3. Configureer crawlers met de juiste classifiers (ingebouwde CSV/JSON/Parquet of aangepaste grok/regex) en geef de crawler een IAM-rol met s3:GetObject/s3:ListBucket en glue:catalog-permissies — het ontbreken hiervan is een veelvoorkomende operationele fout.

Gebruik bij het configureren van Glue-jobs en -crawlers deze console/CLI-patronen en -schakelaars:

undefined

en starten met

undefined

.

undefined

; activeer job bookmarks om herverwerking te voorkomen. Beslissingscriteria voor Glue versus alternatieven:

Streaming-opname met Kinesis Data Streams en Firehose

Kinesis Data Streams (KDS) is voor realtime opname met de mogelijkheid tot opnieuw afspelen, consumentencontrole en fijnmazige schaalvergroting. Een Kinesis-shard biedt 1 MB/sec of 1.000 records/sec schrijfcapaciteit en 2 MB/sec leescapaciteit; gebruik

undefined

en plaats data met

undefined

. Partitiesleutels bepalen de toewijzing aan shards; een lage kardinaliteit van partitiesleutels veroorzaakt ‘hot shards’ — vermijd dit door de entropie van de sleutel te verhogen of een hash als achtervoegsel toe te voegen. Schaal shards op met

undefined

of activeer de On-Demand-modus voor automatisch schalen.

Firehose is een ‘delivery stream’-service die is geoptimaliseerd voor near-realtime levering (S3, Redshift, OpenSearch, Splunk) met ingebouwde buffering, compressie en optionele Lambda-transformatie. Configureer buffering met BufferingHints: buffer_size (MB) en buffer_interval (seconden) om de leveringslatentie versus de kosten af te stemmen; activeer compressie (GZIP, Snappy) en stel een verwerkende Lambda in voor transformaties op recordniveau. Belangrijkste verschillen:

Kies KDS wanneer je de mogelijkheid tot opnieuw afspelen, sterke consumentencontrole of meerdere downstream-consumenten nodig hebt; kies Firehose wanneer je eenvoudige levering en transformatie naar S3/Redshift/OpenSearch nodig hebt met minimale operationele overhead.

Databasemigratie en CDC met DMS

AWS DMS wordt gebruikt voor homogene/heterogene migraties en continue replicatie (CDC). Implementeer een replicatie-instance (

undefined

) die is gedimensioneerd voor de doorvoer, waarbij de beslissingen over de grootte worden bepaald door de wijzigingssnelheid, het volume van de volledige lading en de parallelliteit van de taken. DMS-taaktypen:

Beslissingscriteria tussen full-load en CDC: gebruik full-load+CDC wanneer je een migratie met minimale downtime nodig hebt; gebruik alleen-CDC voor doorlopende replicatie nadat een initiële lading via een ander mechanisme is voltooid. Valideer altijd de schemamapping en voer testmigraties uit op representatieve datavolumes.

Op API’s en events gebaseerde ingestiepatronen

API’s en events zijn voor push-gebaseerde ingestie en orkestratie. Veelvoorkomende patronen:

Operationele aandachtspunten en CLI-patronen:

Veelvoorkomende valkuilen en beslissingscriteria

Praktijkprobleem: Use-Case Scenario

RetailCo verzamelt mobiele clickstreams (hoog volume, real-time) en nachtelijke productcatalogusbestanden; ze hebben real-time dashboards en een geconsolideerd analytics lake nodig.

  1. Ingesteer clickstreams in Kinesis Data Streams met partitiesleutels afgeleid van de gebruikerssessie + een gehasht shard-suffix; creëer consumers met Kinesis Data Analytics of Lambda/Kinesis Client Library voor real-time verwerking.
  2. Gebruik Kinesis Data Firehose met een transformatie-Lambda om verrijkte streaming-output te persisteren naar S3 (Parquet), comprimeer met Snappy, en laad optioneel naar Redshift Spectrum voor analyses.
  3. Plaats nachtelijke catalogusbestanden in S3 raw/ en voer een geplande Glue crawler uit om de Glue Data Catalog bij te werken, voer vervolgens Glue ETL-jobs uit om te converteren naar gepartitioneerde Parquet in de ‘curated zone’.
  4. Gebruik S3 event notifications -> SNS -> Lambda om lichtgewicht metadata-updates te triggeren of caches te invalideren; routeer de levering naar SQS voor duurzame downstream verwerking.
  5. Monitor Kinesis shard-statistieken (IncomingBytes, IncomingRecords, PutRecords.Success) en gebruik UpdateShardCount of On-Demand streams om groei op te vangen; schakel CloudWatch-alarmen in.

Rationale van AWS best practices: scheid real-time en batch paden, gebruik Kinesis Data Streams wanneer replay en consumer-isolatie vereist zijn, gebruik Firehose voor beheerde levering aan S3/bestemmingen, en onderhoud een Glue Data Catalog voor discovery en query-integratie met Athena/Redshift.


Alle domeinen · Dataopslag en Lake-architectuur

Oefen deze vragen → · Getimede oefening op ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Slaag voor je examen →

Blader door Amazon →

Related guides

Alles-in-één toegang

Eén abonnement. Elk examen.

Elk plan ontgrendelt onbeperkt zoeken naar antwoorden, oefentests, AI-uitleg en de volledige bronnenbibliotheek — in meer dan 20 talen.

Maandelijks
24.87
Just €0.83/day
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

Beste waarde
12 maanden
179.87
Just €0.49/daySave 40%
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

✓ Gratis plan inbegrepen · ✓ Annuleer op elk moment · ✓ Alle plannen ontgrendelen het volledige product