Amazon DOP-C02: Monitorowanie, logowanie i obserwowalność — Przewodnik do nauki

Część AWS DevOps Engineer Professional DOP-C02 — Przewodnik do nauki. Ćwicz ze zweryfikowanymi odpowiedziami w centrum egzaminów Amazon, albo rozwiąż testy na czas na ExamRoll.io.

Przegląd

Monitorowanie, logowanie i obserwowalność w AWS wymagają łączenia metryk, logów, śladów (traces), zdarzeń i telemetrii kondycji w użyteczne sygnały. Efektywne architektury wykorzystują Amazon CloudWatch do obsługi metryk, alarmów i dashboardów; CloudWatch Logs i Logs Insights do pozyskiwania i analizy logów; AWS X-Ray do śledzenia rozproszonego (distributed tracing); AWS CloudTrail do audytu i zapewnienia integralności; Amazon EventBridge do wykrywania i automatyzacji opartej na zdarzeniach; AWS Health do zdarzeń serwisowych specyficznych dla konta; oraz scentralizowane potoki (Kinesis Data Firehose i OpenSearch) do wyszukiwania i korelacji na dużą skalę. Poniższe wzorce kładą nacisk na redukcję szumu, precyzyjne kierowanie sygnałów, automatyzację oraz operacje w środowiskach wielokontowych i wieloregionowych.

Metryki, alarmy, dashboardy i alarmy złożone CloudWatch

Metryki CloudWatch są podstawą dla SLO, skalowania i alertów. Publikuj niestandardowe metryki z precyzyjnymi wymiarami, aby izolować sygnały (na przykład apiOperation, appVersion, statusCode). Używaj formatu CloudWatch Embedded Metric Format (EMF) ze strukturalnymi logami, aby efektywnie emitować wymiary o wysokiej kardynalności z Lambda, kontenerów i EC2, unikając narzutu związanego z API PutMetricData.

Konfiguruj alarmy z solidną ewaluacją:

Alarmy złożone (Composite alarms) redukują zmęczenie alarmami, łącząc wiele alarmów składowych za pomocą logiki AND/OR. Na przykład, alarmuj tylko wtedy, gdy latencja p95 jest wysoka ORAZ wskaźnik błędów 5xx przekracza próg ORAZ nasycenie CPU utrzymuje się, co pozwala dostosować alerty do rzeczywistego wpływu na użytkownika. Alarmy złożone akceptują aktualizacje stanu od alarmów podrzędnych z różnych regionów/kont za pośrednictwem obserwowalności międzykontowej lub strumieni metryk (metric streams) do konta centralnego.

Dashboardy wizualizują kluczowe wskaźniki z różnych usług. Używaj widżetów do wyświetlania metryk, wyników zapytań Logs Insights i statusu alarmów. Standaryzuj konwencje dotyczące dashboardów (nazewnictwo, zakresy czasowe, nakładki z SLO) i wykorzystuj widoki międzyregionalne i międzykontowe za pomocą CloudWatch Observability Access Manager (OAM). Do korelacji ad hoc, przypinaj widżety Logs Insights i X-Ray ServiceLens obok widżetów mapy usług i wskaźników błędów Kinesis Firehose.

CloudWatch Logs: Grupy logów, filtry metryk, filtry subskrypcji i Logs Insights

Strukturuj grupy logów według aplikacji/komponentu i etapu cyklu życia. Ustawiaj jawne polityki retencji (nie polegaj na opcji „Never Expire”) i włączaj szyfrowanie KMS tam, gdzie jest to wymagane. Używaj polityk zasobów i precyzyjnych uprawnień IAM do kontrolowania producentów i subskrybentów. W przypadku pozyskiwania danych o wysokiej przepustowości, zapewnij odpowiednią współbieżność strumieni logów i batching.

Filtry metryk (Metric filters) przekształcają wzorce w logach na metryki. Zdefiniuj wzorzec filtra z wyodrębnionymi tokenami (w formacie JSON lub rozdzielanymi spacją) i przypisz tokeny do wymiarów metryk. Umożliwia to realizację przypadków użycia, takich jak publikowanie metryk per-API, per-wersja, per-kod-odpowiedzi bezpośrednio z logów, bez modyfikowania producentów. Upewnij się, że jednostki i wartości domyślne są poprawne; preferuj wartość 1 na zdarzenie i obliczaj wskaźniki za pomocą metric math. Używaj tych metryk do alertów SLO i na dashboardach.

Filtry subskrypcji (Subscription filters) strumieniują logi w czasie zbliżonym do rzeczywistego do:

CloudWatch Logs Insights umożliwia interaktywne, serwerowe zapytania do logów. Podstawowe operatory to fields, filter, parse, stats, sort, limit, dedup oraz bin do grupowania w przedziałach czasowych. Parsuj pola JSON lub używaj parsowania w stylu grok dla logów tekstowych. Przykłady:

AWS X-Ray: Śledzenie, reguły próbkowania, mapy usług i adnotacje

X-Ray przechwytuje rozproszone ślady (traces) między usługami, aby znaleźć źródła opóźnień i granice błędów. Instrumentuj usługi za pomocą AWS Distro for OpenTelemetry (ADOT) lub X-Ray SDK, propaguj nagłówek śledzenia (np. X-Amzn-Trace-Id) i uruchamiaj demona/agenta X-Ray tam, gdzie jest to potrzebne (ECS/EKS/EC2). Wiele usług zarządzanych integruje się natywnie (API Gateway, ALB poprzez logi dostępowe przekazujące ślady, Lambda z aktywnym śledzeniem, Step Functions poprzez subsegmenty).

Reguły próbkowania (sampling rules) kontrolują wolumen danych i wierność sygnału. Użyj centralnego zestawu reguł próbkowania z:

Mapy usług (service maps) wizualizują graf wywołań, pokazując krawędzie z opóźnieniami, wskaźnikami błędów i wskaźnikami dławienia (throttling). Analizuj szczegółowo ślady (traces), aby badać segmenty i subsegmenty pod kątem zależności podrzędnych (downstream). Używaj adnotacji (indeksowane pary klucz-wartość) do filtrowania o wysokiej kardynalności, takich jak customerTier, apiOperation, appVersion lub identyfikatory żądań AWS. Używaj metadanych do przechowywania szczegółowego, nieindeksowanego kontekstu, aby uniknąć nadmiernego rozrostu indeksu. Połącz grupy śledzenia X-Ray z CloudWatch ServiceLens, aby korelować logi, metryki i ślady w jednym widoku. Twórz wyrażenia filtrujące (np.

undefined

), aby izolować regresje i eksportować identyfikatory śladów do ukierunkowanego przeszukiwania logów.

Zarządzanie i zdarzenia: CloudTrail, EventBridge i AWS Health

CloudTrail rejestruje aktywność API na potrzeby zarządzania (governance) i analizy śledczej. Włącz ścieżkę (trail) organizacyjną na wszystkich kontach i we wszystkich regionach, dostarczaj logi do scentralizowanego bucketu S3 z SSE-KMS, włącz walidację plików logów i zintegruj z CloudWatch Logs w celu wykrywania zdarzeń w czasie zbliżonym do rzeczywistego. Rozróżnij klasy zdarzeń:

undefined

podczas audytów.

EventBridge dostarcza szynę zdarzeń (event fabric) do wykrywania i automatyzacji. Używaj domyślnej magistrali zdarzeń (default event bus) dla zdarzeń usług AWS i twórz niestandardowe magistrale dla zdarzeń z domeny aplikacji. Definiuj wzorce zdarzeń (event patterns) dopasowujące źródło (source), typ szczegółów (detail-type), pola szczegółów (detail), prefiksy, zakresy numeryczne i warunki „wszystko oprócz” (anything-but). Stosuj transformatory wejściowe (input transformers) do przekształcania zdarzeń, dołączaj polityki oparte na zasobach (resource-based policies) do publikowania między kontami i konfiguruj ponawianie prób (retry) / DLQ na celach (targets). Typowe cele (targets) obejmują Lambda (naprawa), Step Functions (orkiestracja), SQS (odsprzęganie), Systems Manager Automation (działania operacyjne), CodePipeline (wyzwalacze CI) i SNS (powiadomienia). Archiwizuj i odtwarzaj zdarzenia, aby odzyskać sprawność po awariach konsumentów, i używaj rejestru schematów (schema registry) do generowania silnie typowanych modeli zdarzeń.

AWS Health udostępnia specyficzne dla konta zdarzenia serwisowe, zaplanowane zmiany i problemy operacyjne. Integruj poprzez EventBridge ze źródłem

undefined

i typem szczegółów

undefined

, aby kierować zdarzenia do kanałów incydentów, otwierać OpsItems w OpsCenter lub wyzwalać bezpieczne zamykanie/skalowanie na czas okien konserwacyjnych. Użyj widoku organizacyjnego (Organizational View) z delegowanym kontem administratora, aby agregować zdarzenia Health ze wszystkich kont, i rozważ użycie AWS Health API lub rozwiązania AWS Health Aware do przesyłania wyselekcjonowanych powiadomień do systemów dyżurów (on-call).

Scentralizowane logowanie za pomocą Kinesis Data Firehose i OpenSearch

Strategia logowania obejmująca wiele kont i regionów (multi-account, multi-Region) standaryzuje pozyskiwanie i przeszukiwanie danych. Na każdym koncie produkującym logi (producer account) skonfiguruj filtry subskrypcji CloudWatch Logs do docelowego zasobu Logs na innym koncie (cross-account), który jest obsługiwany przez centralny strumień Kinesis Data Firehose. Włącz funkcje Firehose:

Połącz ten potok (pipeline) z filtrami metryk CloudWatch w celu uzyskania szybkich, tanich liczników oraz z Logs Insights do dogłębnych zapytań ad hoc. Używaj reguł EventBridge wyzwalanych przez anomalie w Firehose/OpenSearch lub alarmy CloudWatch, aby inicjować działania naprawcze (remediations) lub zgłaszać incydenty.

Praktyczny scenariusz problemowy

Airbnb doświadcza okresowych skoków błędów i opóźnień API w mikrousługach wdrożonych na EKS i Lambda, przy wielu wersjach aplikacji mobilnej dostępnych dla użytkowników. Dział operacyjny (Operations) potrzebuje wykrywania w czasie zbliżonym do rzeczywistego z podziałem na operację API, kod odpowiedzi i wersję aplikacji; szybkiej analizy przyczyn źródłowych (root cause analysis) na podstawie śladów (traces) i logów; zautomatyzowanej naprawy dla znanych wzorców awarii; oraz ścieżek audytowych (audit trails) spełniających wymogi ładu korporacyjnego (governance).

  1. Standaryzacja logowania strukturalnego
  1. Tworzenie filtrów metryk w CloudWatch Logs
  1. Budowa warstwowych alarmów CloudWatch i alarmu złożonego (composite alarm)
  1. Wdrożenie śledzenia X-Ray z ukierunkowanym próbkowaniem (sampling)
  1. Korelacja danych za pomocą ServiceLens i Logs Insights

undefined

).

  1. Centralizacja logów przez Firehose do OpenSearch i S3
  1. Automatyzacja wykrywania i naprawy za pomocą EventBridge
  1. Integracja z AWS Health i obsługa prac konserwacyjnych
  1. Wzmocnienie ładu korporacyjnego (governance) za pomocą ścieżki CloudTrail dla organizacji i weryfikacji integralności
  1. Powiadomienia i integracja z działem operacyjnym (Ops)

Ten projekt został wybrany, aby połączyć metryki o niskim opóźnieniu i bogatych wymiarach (CloudWatch + EMF), głęboką korelację śladów (X-Ray + ServiceLens), przeszukiwanie na dużą skalę (OpenSearch + S3/Athena), naprawę sterowaną zdarzeniami (EventBridge + Lambda/SSM/Step Functions) oraz audytowalny ład korporacyjny (CloudTrail z weryfikacją integralności). Równoważy on koszty i wierność odwzorowania danych poprzez próbkowanie, warstwy retencji i ukierunkowane alarmy, które odzwierciedlają rzeczywisty wpływ na użytkownika.


Infrastruktura jako kod i zarządzanie konfiguracją · Wszystkie domeny · Bezpieczeństwo

Przećwicz te pytania → · Testy na czas na ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Zdaj egzamin →

Przeglądaj Amazon →

Related guides

Dostęp all-in-one

Jedna subskrypcja. Każdy egzamin.

Każdy plan odblokowuje nieograniczone wyszukiwanie odpowiedzi, testy praktyczne, wyjaśnienia AI i pełną bibliotekę zasobów — w ponad 20 językach.

Miesięczny
24.87
Just €0.83/day
Wszystko w cenie:
  • Nieograniczone wyszukiwanie odpowiedzi
  • Nieograniczone testy praktyczne
  • Wyjaśnienia wspomagane AI
  • Pełna biblioteka zasobów
  • Ponad 20 języków
  • Cotygodniowe aktualizacje treści
  • Nagrody i polecenia
  • Priorytetowe wsparcie
Rozpocznij bezpłatny okres próbny

Karta kredytowa nie jest wymagana*

Najlepsza wartość
12 miesięcy
179.87
Just €0.49/daySave 40%
Wszystko w cenie:
  • Nieograniczone wyszukiwanie odpowiedzi
  • Nieograniczone testy praktyczne
  • Wyjaśnienia wspomagane AI
  • Pełna biblioteka zasobów
  • Ponad 20 języków
  • Cotygodniowe aktualizacje treści
  • Nagrody i polecenia
  • Priorytetowe wsparcie
Rozpocznij bezpłatny okres próbny

Karta kredytowa nie jest wymagana*

✓ Plan darmowy w zestawie · ✓ Anuluj w dowolnym momencie · ✓ Wszystkie plany odblokowują pełny produkt