Amazon DEA-C01: Monitoring en probleemoplossing van datapipelines — Studiegids

Onderdeel van de Amazon Data Engineer Associate DEA-C01 — Studiegids. Oefen met geverifieerde antwoorden in het Amazon-examencentrum, of doe getimede oefentests op ExamRoll.io.

Monitoring en troubleshooting van datapipelines is cruciaal om een tijdige en accurate levering van streaming- en batchdata binnen AWS te garanderen. Dit domein omvat de telemetrie, alarmering en diagnostische technieken voor services zoals Kinesis, Firehose, Glue, DMS, Lambda, en de AWS audit trails die incidentonderzoek ondersteunen. Effectieve monitoring reduceert de Mean Time To Detect/Recover door het blootleggen van consumer lag, resource-druk op jobs, leveringslatentie en ongeautoriseerde toegang. De volgende secties geven concrete signalen, CLI/console-patronen en beslissingscriteria om productie-dataflows te beheren en te herstellen.

CloudWatch metrics en alarmen voor dataservices

CloudWatch is de primaire telemetrie-laag: maak metric filters, dashboards en alarmen aan voor belangrijke service-metrics en integreer alarmen met SNS, EventBridge of Systems Manager voor geautomatiseerd herstel. Gebruik aws cloudwatch put-metric-alarm om alarmen programmatisch aan te maken; typische flags zijn –metric-name, –namespace, –statistic (of –extended-stat), –threshold, –evaluation-periods en –comparison-operator. Voor dashboards kunt u custom metrics (bijv. uit Glue job-metadata) pushen met aws cloudwatch put-metric-data en een namespace zoals “MyCompany/DataPipeline”.

Focus op deze bruikbare metrics en patronen:

Beslissingscriteria voor alarmering:

Monitoring en foutafhandeling van Glue-jobs

Glue verstuurt metrics naar CloudWatch en schrijft logs naar /aws-glue/jobs/output (job run logs) en /aws-glue/jobs/error (fouten). Gebruik CloudWatch Logs Insights om job runs te query’en: voer query’s uit via de console of met aws logs start-query met een query string zoals fields @timestamp, @message | filter @message like /ERROR/ | sort @timestamp desc | limit 20. Volg BytesRead, BytesWritten, RecordsProcessed en DPUHrs uit de Glue job run metrics—DPUHrs correleert direct met de kosten en de parallelliteit van de job.

Veelvoorkomende Glue-fouten en herstelmaatregelen:

Afwegingen bij beslissingen:

Monitoring van Kinesis en Firehose

Kinesis Consumer Lag: vertrouw op GetRecords.IteratorAgeMilliseconds om te detecteren hoe ver consumers achterlopen. Als GetRecords.IteratorAgeMilliseconds consistent hoog is:

Gebruik aws kinesis describe-stream om het aantal shards te inspecteren en aws cloudwatch get-metric-statistics voor IteratorAgeMilliseconds. Houd bij het vergelijken van herstelopties rekening met het volgende:

Firehose leveringsmetrics: DeliveryToS3.DataFreshness kwantificeert de leveringslatentie; typische buffering_delay-instellingen zijn 60–900 seconden en houden records vast totdat bufferSize of bufferInterval is bereikt. Als DeliveryToS3.DataFreshness hoog is:

Onthoud de buffer-semantiek van Firehose: de service vertraagt opzettelijk tot het bufferinterval; verlaag het bufferinterval om de latentie te verkleinen, ten koste van frequentere schrijfacties naar S3.

CloudTrail en auditing van datatoegang

CloudTrail levert API-activiteit en, optioneel, data-events voor S3 en Lambda, die niet standaard zijn ingeschakeld. Om S3-events op objectniveau vast te leggen, moet je expliciet data-events inschakelen op de CloudTrail via de console of met aws cloudtrail create-trail --include-global-service-events en S3-dataresources toevoegen. Zonder S3 data-events in te schakelen, zie je geen GetObject/PutObject in CloudTrail, wat een veelvoorkomend hiaat is tijdens onderzoeken.

Gebruik CloudTrail-logs in combinatie met CloudWatch Logs Insights om operationele metrics (bijv. logs van Glue-jobs) te correleren met toegangs-events. Query-patronen:

DMS-replicatietaken publiceren ook CloudWatch-metrics: monitor FullLoadRows voor de volledigheid van de initiële kopie, CDCLatencyMilliseconds om replicatievertraging (lag) te detecteren, en AppliedChanges om te verzekeren dat transacties worden toegepast op de doel-database. Stel een alarm in voor CDCLatencyMilliseconds die de zakelijke SLA’s overschrijden en voor lage AppliedChanges na een toename in het aantal ‘full load rows’.

Veelvoorkomende valkuilen en beslissingscriteria

Praktijkprobleem: Use-Case Scenario

Acme Analytics voert real-time clickstream-ingestie uit via Kinesis, verrijkt events met Glue ETL-jobs, persisteert verouderde batches via Firehose naar S3, en repliceert legacy databases met DMS. Ze constateren end-to-end vertragingen: consumer-lag op Kinesis, OOM-fouten bij Glue-jobs, en Firehose die een hoge DeliveryToS3.DataFreshness laat zien.

  1. Profileer Kinesis-consumers: haal de GetRecords.IteratorAgeMilliseconds-metric op, inspecteer de consumer-logs, en voer een kostenanalyse uit van Kinesis enhanced fan-out versus het opschalen van shards.
  2. Onderzoek de CloudWatch-metrics en Logs Insights van de Glue-job op OOM-stacktraces; test herpartitionering + ‘pushdown predicate’ lokaal of in een kleinere job; verhoog pas daarna het aantal DPU’s/worker-type indien nodig.
  3. Inspecteer de bufferinstellingen van Firehose (BufferIntervalInSeconds) en DeliveryToS3.DataFreshness; verlaag het bufferinterval voor kritieke SLO’s en valideer de S3-schrijfrechten/KMS.
  4. Configureer CloudWatch ‘composite alarms’ die IteratorAgeMilliseconds, de foutratio van de Glue-job en Firehose DataFreshness combineren; lever de meldingen af bij een on-call SNS-topic en trigger een runbook via EventBridge.
  5. Schakel CloudTrail S3 data-events in en correleer GetObject/PutObject-events met de starttijden van Glue-jobs en DMS ‘applied changes’ om ongeautoriseerde of vertraagde toegang te detecteren.

Deze aanpak volgt de best practices van AWS: monitor de juiste service-metrics op de correcte granulariteit, geef de voorkeur aan gerichte oplossingen in code en configuratie voordat je resources opschaalt, en zorg ervoor dat logging op auditniveau expliciet is ingeschakeld om snelle root-cause-analyse en geautomatiseerde herstelacties mogelijk te maken.


Databeveiliging · Alle domeinen · Kostenoptimalisatie voor dataworkloads

Oefen deze vragen → · Getimede oefening op ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Slaag voor je examen →

Blader door Amazon →

Related guides

Alles-in-één toegang

Eén abonnement. Elk examen.

Elk plan ontgrendelt onbeperkt zoeken naar antwoorden, oefentests, AI-uitleg en de volledige bronnenbibliotheek — in meer dan 20 talen.

Maandelijks
24.87
Just €0.83/day
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

Beste waarde
12 maanden
179.87
Just €0.49/daySave 40%
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

✓ Gratis plan inbegrepen · ✓ Annuleer op elk moment · ✓ Alle plannen ontgrendelen het volledige product