Amazon SOA-C02: Monitoring, Logging en Herstel — Studiegids
Onderdeel van de AWS SysOps Administrator Associate SOA-C02 — Studiegids. Oefen met geverifieerde antwoorden in het Amazon-examencentrum, of doe getimede oefentests op ExamRoll.io.
Monitoring, logging en herstel vormen het operationele zenuwstelsel voor AWS-omgevingen: ze detecteren problemen, geven context en sturen corrigerende acties aan. Dit domein omvat het creëren van zinvolle metrics en dashboards, het kosteneffectief verzamelen en bewaren van logs, het opbouwen van traceerbare applicatie-observability en het automatiseren van alerts en herstelacties. Goede implementaties balanceren de signaal-ruisverhouding, beheersen de kosten en zorgen ervoor dat playbooks en automatiseringen getest en auditeerbaar zijn.
CloudWatch-metrics, -dashboards en -alarms
Ontwerp metrics rondom zakelijke en operationele SLI’s (latency, error rate, wachtrijdiepte, CPU/geheugen voor infra). Gebruik ingebouwde metrics (EC2, RDS, ELB) plus custom metrics via PutMetricData voor tellers op applicatieniveau (
undefined
). Geef de voorkeur aan dimensies die filteren mogelijk maken (InstanceId, ServiceName) en vermijd dimensies met een hoge kardinaliteit die de kosten van metrics doen exploderen.
Gebruik CloudWatch-dashboards om metrics, logs en alarms te combineren tot operationele overzichten. Creëer widgets in de console of via CloudFormation (AWS::CloudWatch::Dashboard) met metric math voor afgeleide metrics: bereken de error rate met metric math (ERRORS/SUM(REQUESTS)) en toon percentielen (p50, p90, p99). Kies voor alarms configuratiepatronen op basis van het doel:
- Alarms voor één metric voor eenvoudige drempelwaarden:
undefined
- Composite alarms om ruis te verminderen door condities (AND/OR) over meerdere alarms te combineren.
- Anomaly detection om drempelwaarden automatisch aan te passen: gebruik CloudWatch anomaly detection op een metric met verwacht seizoensgebonden gedrag.
Beslissingscriteria: gebruik evaluatieperiodes en ‘datapoint-to-alarm’-instellingen om ‘flapping’ (snel wisselende statussen) te voorkomen; trigger SNS, Auto Scaling of Systems Manager Automation als alarmacties. Geef de voorkeur aan composite alarms en anomaly detection voor omgevingen met variabele basislijnen.
CloudWatch Logs, Logs Insights en retentie
Verzamel logs met CloudWatch Logs-groepen en structureer ze op basis van applicatie en omgeving. Creëer log-groepen via de CLI:
undefined
en dwing retentie af met
undefined
. Gebruik subscription filters om logs te streamen naar Kinesis Data Firehose (voor S3/Redshift), Lambda (real-time verwerking) of partner-tools; comprimeer en partitioneer in S3 om opslagkosten te verlagen.
Gebruik CloudWatch Logs Insights voor ad-hoc queries en dashboards; bouw opgeslagen queries die trace-ID’s en foutcontexten extraheren (bijv.
undefined
). Praktijken voor kostenbeheersing van retentie en ingestie:
- Stel per log-groep een gepaste retentieperiode in (7/30/90/365 dagen) op basis van compliance- en troubleshooting-vereisten.
- Exporteer oudere logs naar S3 via een retentie-lifecycle of Firehose met compressie en lifecycle rules naar Glacier/Archive.
- Gebruik sampling of gestructureerde logs (JSON) en Embedded Metric Format (EMF) om dure logs met hoge kardinaliteit te verminderen, terwijl er nog steeds metrics uit afgeleid kunnen worden.
Beslissingscriteria: korte retentie voor uitgebreide debug-logs, langere retentie voor audit-/security-logs; routeer logs met een hoog volume naar S3 in plaats van onbeperkte retentie in CloudWatch.
CloudTrail, audit trails en eventgeschiedenis
Schakel CloudTrail in voor alle regio’s en accounts; maak een organization trail aan voor gecentraliseerde audit-logging naar een beveiligde S3-bucket, met logbestandsvalidatie en SSE-KMS-encryptie. Configureer management events (Read/Write) en schakel selectief data events in (S3 object-level, Lambda function invoke) waar een gedetailleerde audit vereist is, omdat data events een hoger volume en hogere kosten hebben.
Gebruik de CloudTrail event history in de console voor snelle zoekopdrachten over 90 dagen en CloudTrail Lake of Athena op geëxporteerde S3-logs voor langetermijnanalyses en -onderzoeken. Beveilig de trail door:
- Multi-region trails af te dwingen om gebeurtenissen van globale services vast te leggen.
- CloudTrail te integreren met CloudWatch Logs voor bijna-real-time detectie, of met EventBridge om specifieke events door te sturen naar Lambda/Systems Manager voor geautomatiseerd herstel.
- S3 bucket policies en S3 Object Lock (indien nodig) toe te passen om manipulatie te voorkomen.
Beslissingscriteria: schakel data events alleen in voor buckets/functies waar forensische zichtbaarheid noodzakelijk is; gebruik gecentraliseerde trails en toegangspatronen over accounts heen om compliance te vereenvoudigen.
Applicatie-tracing en observability (X-Ray)
Instrumenteer applicaties met AWS X-Ray SDK’s om segmenten en subsegmenten uit te zenden. Voor niet-geïnstrumenteerde runtimes, draai de X-Ray-daemon/agent als een sidecar of service (ECS-task, EC2-daemon of ingebouwde tracing in Lambda). Configureer sampling-regels om het volume van traces te beheersen en stel service maps in ServiceLens in om afhankelijkheden tussen services te visualiseren. Annoteer traces met business keys (userId, orderId) en leg exceptions/metadata vast om triage te ondersteunen.
Correleer traces met logs door de X-Ray trace-ID op te nemen in applicatielogs (gebruik de trace header of SDK om de huidige trace-ID te verkrijgen), zodat CloudWatch Logs Insights-queries logs en traces kunnen samenvoegen. Schakel voor Lambda actieve tracing in (via de Console of
undefined
) om automatisch traces naar X-Ray te versturen. Gebruik trace-analytics om tail latencies, hotspots en de uitsplitsing van database-aanroepen te detecteren.
Beslissingscriteria: schakel tracing in voor kritieke services en gebruik adaptieve sampling om de kosten te beperken; geef de voorkeur aan gestructureerde traces (annotations/metadata) om de correlatie tussen logs en traces deterministisch te maken.
Geautomatiseerde herstelacties en alarmering (EventBridge/Lambda)
Gebruik EventBridge-regels om CloudWatch Alarm-statuswijzigingen, CloudTrail-events of aangepaste events te matchen en door te sturen naar targets zoals Lambda, Systems Manager Automation-documenten, Step Functions of SNS. Maak regels met input transformers om minimale context door te geven aan de herstelactie (
undefined
). Implementeer Lambda-functies voor lichtgewicht herstelacties (een service herstarten, credentials intrekken) maar gebruik SSM Automation of Step Functions voor langdurige, auditeerbare playbooks met checkpoints.
Ontwerp herstelacties met veiligheid in het achterhoofd: implementeer dry-run-modi, idempotentiefuncties, validatiestappen, IAM least-privilege, logging en een kill-switch. Gebruik dead-letter queues en retry-beleidsregels voor EventBridge/Lambda-integraties en publiceer herstelpogingen naar een auditlog of security trail. Test automatiseringen in een staging-account en voer canary-tests uit na de implementatie.
Beslissingscriteria: geef de voorkeur aan SSM Automation of Step Functions voor herstelacties met meerdere stappen en menselijke goedkeuring; gebruik Lambda voor eenvoudige, snelle oplossingen. Voeg altijd een handmatige rollback of een ‘human-in-the-loop’-breekpunt toe voor risicovolle acties.
Veelvoorkomende valkuilen en beslissingscriteria
- Vertrouwen op één enkele metric voor statusbeslissingen: combineer metrics (bijv. error rate + latency + throttles) of gebruik composite alarms/metric math om false positives te vermijden.
- Geen rekening houden met de kosten voor logretentie en -opname: stel retentie per log-group in, routeer bulklogs naar S3 via Firehose met compressie, en gebruik lifecycle-beleidsregels om oude data naar goedkopere opslaglagen te verplaatsen.
- Over-instrumentatie met high-cardinality dimensies of uitgeschakelde trace sampling: beperk dimensies en schakel adaptive sampling in om de kosten te beheersen met behoud van signaal.
- Geautomatiseerde herstelacties implementeren zonder te testen: valideer in staging, gebruik dry-run-vlaggen en verzeker idempotentiefuncties en veilige rollbacks voordat je het in productie activeert.
- Alert-moeheid door ’noisy’ alarms: gebruik anomaly detection, composite alarms, onderdrukkingsvensters en escaleer alleen betekenisvolle events naar de on-call-dienst.
- Ontbrekende correlatie tussen logs, metrics en traces: propageer trace-ID’s naar logs en EMF-metrics, en bouw opgeslagen Logs Insights-queries en ServiceLens-views om data aan elkaar te koppelen.
Praktijkprobleem: Use-Case Scenario
Acme Payments ervaart met tussenpozen storingen in de betalingsverwerking tijdens piekverkeer; engineers zien een verhoogde latency en sporadische 5xx-fouten, maar geautomatiseerde herstarts hebben soms de hoofdoorzaak gemaskeerd.
- Instrumenteer de betalingsservice met de X-Ray SDK en EMF-metrics; voeg trace-ID’s toe aan applicatielogs en verstuur gestructureerde metrics OrdersFailed en OrdersProcessed via PutMetricData/EMF.
- Maak CloudWatch metric math aan om de error rate te berekenen (OrdersFailed / OrdersProcessed) en een composite alarm dat error rate > drempelwaarde EN p99 latency > drempelwaarde combineert.
- Routeer alarmacties naar een EventBridge-regel die een Step Functions-workflow triggert voor diagnostische stappen (recente traces/logs verzamelen, health checks uitvoeren) en, indien veilig, een geautomatiseerde herstart via SSM Automation.
- Configureer een CloudTrail- en CloudWatch Logs-subscription om volledige logs te archiveren naar S3 (gecomprimeerd) met een lifecycle naar Glacier, en stel een korte retentie in CloudWatch in voor uitgebreide debug-logs.
- Voer end-to-end tests en canary synthetic transactions (CloudWatch Synthetics) uit om de observability en de herstelflow te valideren voordat je auto-remediation in productie inschakelt.
Rationale: correleer metrics, logs en traces om de hoofdoorzaak te vinden in plaats van herhaaldelijk de symptomen te behandelen; combineer alarms om ruis te verminderen en gebruik auditeerbare, geteste automatisering (Step Functions/SSM) voor veilige herstelacties, terwijl je de kosten voor logopslag beheert.
Alle domeinen · Hoge Beschikbaarheid →
Oefen deze vragen → · Getimede oefening op ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Slaag voor je examen →