Amazon SOA-C02: Monitoring, Logging en Herstel — Studiegids

Onderdeel van de AWS SysOps Administrator Associate SOA-C02 — Studiegids. Oefen met geverifieerde antwoorden in het Amazon-examencentrum, of doe getimede oefentests op ExamRoll.io.

Monitoring, logging en herstel vormen het operationele zenuwstelsel voor AWS-omgevingen: ze detecteren problemen, geven context en sturen corrigerende acties aan. Dit domein omvat het creëren van zinvolle metrics en dashboards, het kosteneffectief verzamelen en bewaren van logs, het opbouwen van traceerbare applicatie-observability en het automatiseren van alerts en herstelacties. Goede implementaties balanceren de signaal-ruisverhouding, beheersen de kosten en zorgen ervoor dat playbooks en automatiseringen getest en auditeerbaar zijn.

CloudWatch-metrics, -dashboards en -alarms

Ontwerp metrics rondom zakelijke en operationele SLI’s (latency, error rate, wachtrijdiepte, CPU/geheugen voor infra). Gebruik ingebouwde metrics (EC2, RDS, ELB) plus custom metrics via PutMetricData voor tellers op applicatieniveau (

undefined

). Geef de voorkeur aan dimensies die filteren mogelijk maken (InstanceId, ServiceName) en vermijd dimensies met een hoge kardinaliteit die de kosten van metrics doen exploderen.

Gebruik CloudWatch-dashboards om metrics, logs en alarms te combineren tot operationele overzichten. Creëer widgets in de console of via CloudFormation (AWS::CloudWatch::Dashboard) met metric math voor afgeleide metrics: bereken de error rate met metric math (ERRORS/SUM(REQUESTS)) en toon percentielen (p50, p90, p99). Kies voor alarms configuratiepatronen op basis van het doel:

undefined

Beslissingscriteria: gebruik evaluatieperiodes en ‘datapoint-to-alarm’-instellingen om ‘flapping’ (snel wisselende statussen) te voorkomen; trigger SNS, Auto Scaling of Systems Manager Automation als alarmacties. Geef de voorkeur aan composite alarms en anomaly detection voor omgevingen met variabele basislijnen.

CloudWatch Logs, Logs Insights en retentie

Verzamel logs met CloudWatch Logs-groepen en structureer ze op basis van applicatie en omgeving. Creëer log-groepen via de CLI:

undefined

en dwing retentie af met

undefined

. Gebruik subscription filters om logs te streamen naar Kinesis Data Firehose (voor S3/Redshift), Lambda (real-time verwerking) of partner-tools; comprimeer en partitioneer in S3 om opslagkosten te verlagen.

Gebruik CloudWatch Logs Insights voor ad-hoc queries en dashboards; bouw opgeslagen queries die trace-ID’s en foutcontexten extraheren (bijv.

undefined

). Praktijken voor kostenbeheersing van retentie en ingestie:

Beslissingscriteria: korte retentie voor uitgebreide debug-logs, langere retentie voor audit-/security-logs; routeer logs met een hoog volume naar S3 in plaats van onbeperkte retentie in CloudWatch.

CloudTrail, audit trails en eventgeschiedenis

Schakel CloudTrail in voor alle regio’s en accounts; maak een organization trail aan voor gecentraliseerde audit-logging naar een beveiligde S3-bucket, met logbestandsvalidatie en SSE-KMS-encryptie. Configureer management events (Read/Write) en schakel selectief data events in (S3 object-level, Lambda function invoke) waar een gedetailleerde audit vereist is, omdat data events een hoger volume en hogere kosten hebben.

Gebruik de CloudTrail event history in de console voor snelle zoekopdrachten over 90 dagen en CloudTrail Lake of Athena op geëxporteerde S3-logs voor langetermijnanalyses en -onderzoeken. Beveilig de trail door:

Beslissingscriteria: schakel data events alleen in voor buckets/functies waar forensische zichtbaarheid noodzakelijk is; gebruik gecentraliseerde trails en toegangspatronen over accounts heen om compliance te vereenvoudigen.

Applicatie-tracing en observability (X-Ray)

Instrumenteer applicaties met AWS X-Ray SDK’s om segmenten en subsegmenten uit te zenden. Voor niet-geïnstrumenteerde runtimes, draai de X-Ray-daemon/agent als een sidecar of service (ECS-task, EC2-daemon of ingebouwde tracing in Lambda). Configureer sampling-regels om het volume van traces te beheersen en stel service maps in ServiceLens in om afhankelijkheden tussen services te visualiseren. Annoteer traces met business keys (userId, orderId) en leg exceptions/metadata vast om triage te ondersteunen.

Correleer traces met logs door de X-Ray trace-ID op te nemen in applicatielogs (gebruik de trace header of SDK om de huidige trace-ID te verkrijgen), zodat CloudWatch Logs Insights-queries logs en traces kunnen samenvoegen. Schakel voor Lambda actieve tracing in (via de Console of

undefined

) om automatisch traces naar X-Ray te versturen. Gebruik trace-analytics om tail latencies, hotspots en de uitsplitsing van database-aanroepen te detecteren.

Beslissingscriteria: schakel tracing in voor kritieke services en gebruik adaptieve sampling om de kosten te beperken; geef de voorkeur aan gestructureerde traces (annotations/metadata) om de correlatie tussen logs en traces deterministisch te maken.

Geautomatiseerde herstelacties en alarmering (EventBridge/Lambda)

Gebruik EventBridge-regels om CloudWatch Alarm-statuswijzigingen, CloudTrail-events of aangepaste events te matchen en door te sturen naar targets zoals Lambda, Systems Manager Automation-documenten, Step Functions of SNS. Maak regels met input transformers om minimale context door te geven aan de herstelactie (

undefined

). Implementeer Lambda-functies voor lichtgewicht herstelacties (een service herstarten, credentials intrekken) maar gebruik SSM Automation of Step Functions voor langdurige, auditeerbare playbooks met checkpoints.

Ontwerp herstelacties met veiligheid in het achterhoofd: implementeer dry-run-modi, idempotentiefuncties, validatiestappen, IAM least-privilege, logging en een kill-switch. Gebruik dead-letter queues en retry-beleidsregels voor EventBridge/Lambda-integraties en publiceer herstelpogingen naar een auditlog of security trail. Test automatiseringen in een staging-account en voer canary-tests uit na de implementatie.

Beslissingscriteria: geef de voorkeur aan SSM Automation of Step Functions voor herstelacties met meerdere stappen en menselijke goedkeuring; gebruik Lambda voor eenvoudige, snelle oplossingen. Voeg altijd een handmatige rollback of een ‘human-in-the-loop’-breekpunt toe voor risicovolle acties.

Veelvoorkomende valkuilen en beslissingscriteria

Praktijkprobleem: Use-Case Scenario

Acme Payments ervaart met tussenpozen storingen in de betalingsverwerking tijdens piekverkeer; engineers zien een verhoogde latency en sporadische 5xx-fouten, maar geautomatiseerde herstarts hebben soms de hoofdoorzaak gemaskeerd.

  1. Instrumenteer de betalingsservice met de X-Ray SDK en EMF-metrics; voeg trace-ID’s toe aan applicatielogs en verstuur gestructureerde metrics OrdersFailed en OrdersProcessed via PutMetricData/EMF.
  2. Maak CloudWatch metric math aan om de error rate te berekenen (OrdersFailed / OrdersProcessed) en een composite alarm dat error rate > drempelwaarde EN p99 latency > drempelwaarde combineert.
  3. Routeer alarmacties naar een EventBridge-regel die een Step Functions-workflow triggert voor diagnostische stappen (recente traces/logs verzamelen, health checks uitvoeren) en, indien veilig, een geautomatiseerde herstart via SSM Automation.
  4. Configureer een CloudTrail- en CloudWatch Logs-subscription om volledige logs te archiveren naar S3 (gecomprimeerd) met een lifecycle naar Glacier, en stel een korte retentie in CloudWatch in voor uitgebreide debug-logs.
  5. Voer end-to-end tests en canary synthetic transactions (CloudWatch Synthetics) uit om de observability en de herstelflow te valideren voordat je auto-remediation in productie inschakelt.

Rationale: correleer metrics, logs en traces om de hoofdoorzaak te vinden in plaats van herhaaldelijk de symptomen te behandelen; combineer alarms om ruis te verminderen en gebruik auditeerbare, geteste automatisering (Step Functions/SSM) voor veilige herstelacties, terwijl je de kosten voor logopslag beheert.


Alle domeinen · Hoge Beschikbaarheid

Oefen deze vragen → · Getimede oefening op ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Slaag voor je examen →

Blader door Amazon →

Related guides

Alles-in-één toegang

Eén abonnement. Elk examen.

Elk plan ontgrendelt onbeperkt zoeken naar antwoorden, oefentests, AI-uitleg en de volledige bronnenbibliotheek — in meer dan 20 talen.

Maandelijks
24.87
Just €0.83/day
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

Beste waarde
12 maanden
179.87
Just €0.49/daySave 40%
Alles inbegrepen:
  • Onbeperkt zoeken naar antwoorden
  • Onbeperkte oefentests
  • AI-gestuurde uitleg
  • Volledige bronnenbibliotheek
  • 20+ talen
  • Wekelijkse contentupdates
  • Beloningen & verwijzingen
  • Prioriteitsondersteuning
Start gratis proefperiode

Geen creditcard vereist*

✓ Gratis plan inbegrepen · ✓ Annuleer op elk moment · ✓ Alle plannen ontgrendelen het volledige product