Microsoft AZ-104: Azure Monitor, kopie zapasowe i odzyskiwanie po awarii — Przewodnik do nauki
Część Microsoft Azure Administrator Associate AZ-104 — Przewodnik do nauki. Ćwicz ze zweryfikowanymi odpowiedziami w centrum egzaminów Microsoft, albo rozwiąż testy na czas na ExamRoll.io.
Przegląd
Doskonałość operacyjna na platformie Azure wymaga współdziałania trzech filarów: obserwowalnej telemetrii, odzyskiwalnych danych i odpornych planów ciągłości działania. Azure Monitor i jego fundament, Log Analytics, zbierają metryki i logi o wysokiej wierności, napędzają inteligentne alerty i uwidaczniają wydajność aplikacji. Azure Backup chroni dane platformy i IaaS dzięki odzyskiwaniu opartemu na zasadach i magazynach (vault), włączając w to funkcje natychmiastowego przywracania w celu minimalizacji przestojów. Azure Site Recovery (ASR) replikuje obciążenia do alternatywnych lokalizacji oraz orkiestruje procesy failover i failback, aby spełnić biznesowe wymagania RPO/RTO. Usługi uzupełniające — Network Watcher do diagnostyki sieci i Azure Service Health do świadomości o stanie platformy — uzupełniają kompletny zestaw narzędzi administratora.
Azure Monitor i Log Analytics
Azure Monitor unifikuje metryki i logi platformy. Metryki to numeryczne szeregi czasowe zoptymalizowane do analizy w czasie zbliżonym do rzeczywistego (wysoka kardynalność, wielowymiarowość, jednominutowa granulacja dla większości zasobów). Użyj Metrics Explorer do wizualizacji i alertów metryk w czasie zbliżonym do rzeczywistego ze statycznymi lub dynamicznymi progami. Logi to rekordy o bogatej schemie przechowywane w obszarze roboczym Log Analytics, odpytywane za pomocą Kusto Query Language (KQL) w celu prowadzenia dochodzeń, tworzenia pulpitów nawigacyjnych i planowanych alertów (log alerts).
Ustawienia diagnostyczne (Diagnostic settings) są pomostem między zasobami a miejscami docelowymi telemetrii (sinks). Na każdym zasobie Azure skonfiguruj ustawienia diagnostyczne, aby wybrać kategorie (metryki platformy, logi platformy i logi zasobów) i skierować je do jednego lub więcej miejsc docelowych:
- Obszar roboczy Log Analytics do analityki i alertów opartych na logach
- Konta magazynu (Storage accounts) do długoterminowego, taniego przechowywania i zapewnienia zgodności
- Event Hubs do przesyłania strumieniowego do systemów SIEM lub narzędzi firm trzecich
Projektuj obszary robocze Log Analytics w sposób przemyślany:
- Zakres i dostęp do obszaru roboczego: Używaj RBAC na poziomie obszaru roboczego i tabeli, aby zachować zgodność z zasadą najmniejszych uprawnień i granicami operacyjnymi (na przykład według środowiska i regionu). Zapytania w kontekście zasobów (Resource-context queries) pozwalają zespołom odpytywać logi w zakresie zasobów, do których mają dostęp, nawet jeśli logi są scentralizowane.
- Zbieranie danych: Preferuj agenta Azure Monitor agent (AMA) z regułami zbierania danych (Data Collection Rules, DCRs) zamiast starszych agentów. DCRs definiują, co zbierać (liczniki wydajności, dzienniki zdarzeń Windows/Linux, syslog, niestandardowe logi tekstowe), z których maszyn i do których tabel, umożliwiając szczegółowe potoki dla każdego zakresu.
- Koszt i retencja: Kontroluj koszty za pomocą retencji na poziomie tabeli, archiwizacji i logów podstawowych (basic logs), gdy jest to stosowne. W miarę możliwości używaj próbkowania i filtrowania w momencie zbierania danych.
- Źródła danych: Azure Activity Log, logi zasobów przez ustawienia diagnostyczne, VM insights i Container insights, logi logowania i audytu Azure AD (przez ustawienia diagnostyczne), logi przepływu Azure Firewall/NSG, niestandardowe logi aplikacji oraz zasoby on-premise za pośrednictwem agenta Azure Monitor.
Biegłość w KQL jest niezbędna. Przykłady:
- Szybki audyt: AzureActivity | where OperationName startswith “Create” and ActivityStatus == “Succeeded” | summarize count() by Caller
- Analiza wydajności: Perf | where ObjectName == “LogicalDisk” and CounterName == “% Free Space” | summarize min(CounterValue) by Computer, InstanceName
- Wskaźnik błędów: AppTraces | where SeverityLevel >= 3 | summarize Errors=count() by bin(TimeGenerated, 5m)
Grupy akcji (Action groups) definiują, kto i co reaguje na alerty: e-mail/SMS/push/połączenie głosowe, bezpieczne webhooki, konektory ITSM, Functions, Logic Apps i elementy runbook w Automation. Używaj ponownie grup akcji w różnych regułach alertów i wymuszaj spójny routing incydentów.
Azure Monitor obsługuje wiele typów alertów:
- Alerty metryk: Oceniają metryki platformy lub niestandardowe metryki w kadencji zbliżonej do czasu rzeczywistego, używając progów statycznych lub dynamicznych, które uczą się normalnych wzorców bazowych.
- Alerty logów (zapytania zaplanowane): Uruchamiają zapytania KQL na danych w obszarze roboczym z skonfigurowaną częstotliwością; wyzwalane na podstawie liczby wyników lub agregacji numerycznej. Przydatne do wykrywania złożonych wzorców obejmujących wiele zasobów.
- Alerty dziennika aktywności (Activity log alerts): Wyzwalane przez zdarzenia w warstwie kontroli (na przykład, gdy maszyna wirtualna jest usuwana lub zmienia się przypisanie roli). Nie wymagają one obszaru roboczego.
- Inteligentne wykrywanie (Smart detection): Wykrywanie anomalii i skoków wskaźnika błędów, głównie dla zasobów Application Insights; automatycznie powiadamia właścicieli i może integrować się z grupami akcji.
Application Insights i Alerty
Application Insights instrumentuje kod i platformę, aby zapewnić kompleksową telemetrię aplikacji. Używaj parametrów połączenia (connection strings) i dedykowanych zestawów SDK (.NET, Java, Node.js, Python) lub OpenTelemetry do śledzenia neutralnego dla dostawcy. W przypadku usług PaaS (App Service, Functions, AKS) włącz autoinstrumentację tam, gdzie jest dostępna, aby przechwytywać żądania, zależności, wyjątki i ślady bez zmian w kodzie. Utrzymuj kontekst śledzenia rozproszonego, aby korelować przeskoki między klientem, API i backendem.
Kluczowe typy telemetrii:
- Żądania (Requests): Operacje przychodzące z kodami odpowiedzi i czasem trwania
- Zależności (Dependencies): Wywołania wychodzące (HTTP, SQL, kolejki) z czasem trwania i statusem powodzenia
- Wyjątki i ślady (Exceptions and Traces): Błędy i logi diagnostyczne z poziomem ważności
- Metryki (Metrics): Liczniki niestandardowe lub standardowe
- Wyświetlenia stron i czasy przeglądarki (Page views and browser timings): Wydajność front-endu
- Zdarzenia i pomiary niestandardowe (Custom events and measurements): Sygnały specyficzne dla domeny
Stosuj próbkowanie adaptacyjne (adaptive sampling), aby kontrolować wolumen przyjmowanych danych bez utraty wierności sygnału, i używaj Live Metrics Stream, aby uzyskać wgląd z niskim opóźnieniem podczas incydentów.
Testy dostępności (Availability tests) weryfikują zewnętrzną osiągalność i SLA:
- Standardowe testy (ping URL): Sondować punkty końcowe z wielu regionów Azure, weryfikować kody statusu, okna wygaśnięcia certyfikatów SSL, dopasowanie treści i progi czasu odpowiedzi.
- Testy niestandardowe: Użyj TrackAvailability w kodzie dla syntetycznych przepływów pracy lub chronionych punktów końcowych. Awarie mogą automatycznie generować alerty połączone z grupami akcji.
Wzbogać system alertów o inteligentne wykrywanie (smart detection) w Application Insights dla:
- Anomalii awarii i degradacji wydajności
- Wycieków pamięci i anomalii zależności Funkcje te uczą się typowych wzorców i redukują fałszywe alarmy (false positives), uzupełniając alerty oparte na progach.
Azure Backup
Magazyn Recovery Services stanowi centralny punkt zarządzania kopiami zapasowymi, zasadami i odzyskiwaniem. Umieszczaj magazyny w tym samym regionie, co chronione zasoby (lub w regionie sparowanym w przypadku scenariuszy przywracania międzyregionalnego obsługiwanych przez usługę). Wzmocnij zabezpieczenia magazynów za pomocą usuwania nietrwałego, ochrony przed trwałym usunięciem i autoryzacji wieloużytkownikowej dla operacji krytycznych.
Zasady tworzenia kopii zapasowych definiują harmonogramy i retencję:
- Kopia zapasowa Azure VM: Codzienne migawki z retencją krótkoterminową, opcjonalna retencja długoterminowa tygodniowa/miesięczna/roczna; punkty odzyskiwania spójne z aplikacją za pomocą VSS (Windows) lub skryptów pre/post (Linux), jeśli są włączone.
- Kopia zapasowa Azure Files: Codzienne kopie zapasowe oparte na migawkach udziału; retencja zgodna z potrzebami biznesowymi; obsługuje przywracanie do oryginalnego lub alternatywnego udziału z odzyskiwaniem na poziomie elementu.
- SQL Server na maszynach wirtualnych Azure: Pełne (dzienne/tygodniowe), różnicowe (dzienne) i kopie zapasowe dziennika transakcji (nawet co 15 minut) umożliwiają przywracanie do punktu w czasie. Funkcja Auto-protect wykrywa nowe bazy danych.
Funkcja Instant Restore przyspiesza odzyskiwanie maszyn wirtualnych poprzez wykorzystanie lokalnie przechowywanych migawek, utrzymywanych przez krótki czas przed przeniesieniem do magazynu głębokiego w skarbcu. Administratorzy mogą:
- Przywrócić całą maszynę wirtualną (jako nową instancję obliczeniową), aby zminimalizować czas odzyskiwania
- Przywrócić dyski i podłączyć je ponownie do istniejącej maszyny wirtualnej w celu ukierunkowanej naprawy
- Przeprowadzić odzyskiwanie plików i folderów, montując punkt odzyskiwania jako tymczasowe urządzenie iSCSI na dowolnej maszynie wirtualnej w subskrypcji (zgodnie z uprawnieniami roli), co umożliwia precyzyjne przywracanie po zdarzeniach takich jak atak ransomware
Kwestie do rozważenia przy tworzeniu kopii zapasowych maszyn wirtualnych obejmują wykluczenie dysków z danymi niekrytycznymi, obsługę szyfrowania (Azure Backup wspiera dyski szyfrowane) oraz modele spójności (spójność na poziomie awarii vs spójność na poziomie aplikacji). Kopia zapasowa Azure Files wykorzystuje migawki magazynu, czerpiąc korzyści z przyrostowej, oszczędzającej miejsce retencji i ochrony w postaci usuwania nietrwałego. Kopia zapasowa SQL na maszynach wirtualnych Azure używa rozszerzenia świadomego obciążenia roboczego, koordynowanego przez magazyn, do tworzenia zgodnych, odtwarzalnych łańcuchów w grupach dostępności Always On i instancjach autonomicznych.
Azure Site Recovery, Network Watcher i Service Health
ASR zapewnia replikację obciążeń i zorkiestrowane odzyskiwanie:
- Źródła replikacji: Lokalne środowiska VMware/Hyper-V/fizyczne do Azure; między regionami Azure. Usługa Mobility service na chronionych maszynach przechwytuje zmiany i replikuje je do pamięci podręcznej/docelowej. Włącz spójność wielodyskową dla aplikacji wielowarstwowych, które współdzielą kolejność zapisu.
- Konfiguracja docelowa: Wstępnie utwórz lub zmapuj grupy zasobów, sieci VNet/podsieci, opcje dostępności (strefy/zestawy), typy dysków zarządzanych i konwencje nazewnictwa. Użyj mapowania sieci i aktualizacji DNS, aby zapewnić osiągalność po przełączeniu awaryjnym.
- Opcje przełączania awaryjnego (failover): Testowe przełączenie awaryjne (izolowana walidacja bez wpływu na produkcję), planowane przełączenie awaryjne (zero utraty danych z zamknięciem źródła) i nieplanowane przełączenie awaryjne (najlepsza możliwa próba podczas awarii). Po przełączeniu awaryjnym użyj opcji Reprotect, aby odwrócić replikację; Failback (powrót po awarii) jest możliwy, gdy środowisko podstawowe jest gotowe, za pośrednictwem serwerów przetwarzania lub replikacji bezpośredniej, w zależności od źródła.
- Plany odzyskiwania: Orkiestruj wielowarstwowe środowiska maszyn wirtualnych za pomocą grup, kroków ręcznego zatwierdzania oraz skryptów lub elementów runbook usługi Azure Automation (do rozgrzewania aplikacji, rekonfiguracji load balancera i zmian w DNS). Zdefiniuj sekwencjonowanie i limity czasu, aby osiągnąć przewidywalne RTO.
Cele RPO/RTO determinują politykę:
- RPO (dopuszczalna utrata danych) zależy od wskaźnika zmian, przepustowości sieci i częstotliwości replikacji. Ustaw progi RPO, aby generować alerty o stanie kondycji po ich przekroczeniu.
- RTO (czas przywrócenia usługi) zależy od czasu rozruchu, kroków orkiestracji, aktualizacji DNS/połączeń i operacji na płaszczyźnie danych (dołączanie dysku). Dostosuj plany odzyskiwania, wstępnie aprowizuj pojemność i używaj testowych przełączeń awaryjnych, aby zweryfikować, czy cele są osiągane.
- Polityka replikacji definiuje częstotliwość tworzenia spójnych na poziomie aplikacji migawek oraz okresy przechowywania punktów odzyskiwania, aby zrównoważyć koszty magazynu, elastyczność odzyskiwania i wydajność.
Azure Network Watcher wyposaża administratorów w precyzyjne narzędzia do diagnostyki sieci:
- Weryfikacja przepływu IP (IP flow verify): Sprawdza, czy przepływ jest dozwolony czy zablokowany przez obowiązujące reguły NSG na karcie sieciowej (NIC), identyfikując konkretną regułę, która wpływa na decyzję.
- Następny skok (Next hop): Oblicza decyzję routingową dla danego miejsca docelowego (Internet, sieć wirtualna, urządzenie wirtualne), ujawniając obowiązujące trasy zdefiniowane przez użytkownika (UDR) i trasy systemowe.
- Rozwiązywanie problemów z połączeniem (Connection troubleshoot): Wykonuje kompleksowe sondy między źródłem a miejscem docelowym w obrębie sieci VNet i połączeń hybrydowych, raportując osiągalność, opóźnienie i skok, na którym występuje błąd.
- Przechwytywanie pakietów (Packet capture): Przechwytuje pakiety na karcie sieciowej maszyny wirtualnej z filtrami (protokół/port/IP), zapisując je na koncie magazynu lub lokalnie, co jest przydatne do dogłębnej inspekcji sporadycznych problemów. Wymaga rozszerzenia Network Watcher na maszynie wirtualnej.
Azure Service Health uzupełnia monitorowanie o świadomość stanu platformy:
- Problemy z usługą (Service issues): Zdarzenia awarii i pogorszenia wydajności w czasie rzeczywistym, wpływające na wybrane usługi i regiony, z aktualizacjami dotyczącymi przyczyny źródłowej i środków zaradczych.
- Planowana konserwacja (Planned maintenance): Powiadomienia o nadchodzących oknach konserwacyjnych platformy, które mogą wpłynąć na obciążenia, wraz z harmonogramami i wymaganymi działaniami.
- Zalecenia dotyczące kondycji (Health advisories): Zalecenia dotyczące najlepszych praktyk i bezpieczeństwa, które mogą wymagać zmian w konfiguracji. Twórz alerty Service Health o zakresie ograniczonym do usług/regionów/subskrypcji i kieruj je za pośrednictwem grup akcji, aby zespoły operacyjne były informowane przed wystąpieniem problemu. Używaj Resource Health do sprawdzania stanu dostępności poszczególnych zasobów (Dostępny, Pogorszony, Niedostępny, Nieznany), aby odróżnić problemy platformy od problemów z obciążeniem.
Praktyczny scenariusz problemowy
Firma Adobe musi wzmocnić i wdrożyć operacyjnie nową, dwuregionową platformę e-commerce na Azure, spełniając rygorystyczne cele w zakresie obserwowalności, tworzenia kopii zapasowych i odzyskiwania po awarii, jednocześnie zapewniając szybkie rozwiązywanie problemów sieciowych i świadomość stanu platformy.
Wdróż centralny obszar roboczy Log Analytics w każdym regionie i dołącz reguły zbierania danych (Data Collection Rules) do wszystkich maszyn wirtualnych i węzłów AKS, aby zbierać dane o wydajności, logi syslog/EventLog oraz logi specyficzne dla zasobów za pomocą ustawień diagnostycznych. Dlaczego: Regionalne obszary robocze zachowują rezydencję danych i wydajność; połączenie agenta AMA i reguł DCR zapewnia granularne, skalowalne zbieranie danych i kontrolę kosztów.
Skonfiguruj ustawienia diagnostyczne w usługach App Service, Key Vault, Azure Firewall, Application Gateway i Storage, aby kierować logi i metryki do regionalnego obszaru roboczego oraz na konto magazynu w celu długoterminowego przechowywania. Dlaczego: Scentralizowana analityka umożliwia korelację danych między zasobami; przechowywanie w magazynie spełnia wymogi zgodności i potrzeby analizy śledczej.
Zinstrumentuj warstwy web i API za pomocą Application Insights, używając OpenTelemetry, i włącz autoinstrumentację w App Service. Utwórz testy dostępności z co najmniej pięciu regionów Azure, sprawdzające dopasowanie treści i wygaśnięcie certyfikatu TLS. Dlaczego: Głębokie śledzenie rozproszone i testy syntetyczne wykrywają regresje wpływające na użytkowników, zanim zrobią to klienci.
Utwórz alerty w Azure Monitor:
- Dynamiczne alerty metryk dla użycia CPU, pamięci, wskaźników błędów HTTP 5xx i kondycji zaplecza App Gateway
- Alerty oparte na zaplanowanych zapytaniach KQL dotyczące anomalnych odmów dostępu przez zaporę i nieudanych logowań
- Alerty z dziennika aktywności dla zdarzeń usunięcia/przypisania ról na krytycznych zasobach
- Podłącz wszystkie alerty do współdzielonych grup akcji (e-mail/SMS dla dyżuru, webhook do systemu ITSM, Logic App do otwierania incydentów) Dlaczego: Alerty oparte na wielu sygnałach skracają średni czas wykrywania (MTTD) dzięki kierowaniu powiadomień do odpowiednich osób i systemów.
- Chroń dane za pomocą Azure Backup:
- Włącz tworzenie kopii zapasowych maszyn wirtualnych z politykami uwzględniającymi codzienne backupy i długoterminowe przechowywanie; włącz spójne na poziomie aplikacji migawki tam, gdzie to możliwe
- Chroń udziały Azure Files przechowujące zasoby multimedialne za pomocą codziennych kopii zapasowych i usuwania nietrwałego (soft delete)
- Chroń SQL Server na maszynach wirtualnych Azure za pomocą harmonogramów kopii pełnych/różnicowych/logów, aby wspierać przywracanie do punktu w czasie
- Zweryfikuj funkcję Instant Restore, wykonując przywracanie na poziomie plików w środowisku przejściowym (staging) Dlaczego: Kopie zapasowe oparte na magazynie (vault) i natychmiastowe przywracanie minimalizują przestoje i utratę danych w obciążeniach IaaS i plikowych.
Zaimplementuj Azure Site Recovery do odzyskiwania po awarii (DR) między regionami dla warstw web, API i SQL, z polityką replikacji ukierunkowaną na niskie RPO i cogodzinne punkty spójne na poziomie aplikacji. Zbuduj plan odzyskiwania z warstwami (najpierw dane, potem API, na końcu web), automatyzacją do aktualizacji DNS i czyszczenia pamięci podręcznej CDN oraz kwartalnie przeprowadzaj testowe przełączenie awaryjne w izolowanej sieci VNet. Dlaczego: Replikacja ASR i plany odzyskiwania zapewniają przewidywalne RTO dzięki zorkiestrowanym, audytowalnym elementom runbook i testom bez zakłócania pracy.
Włącz Network Watcher i użyj funkcji Connection troubleshoot do walidacji przepływów między frontendem a backendem, Next hop do weryfikacji tras UDR przez warstwę NVA oraz IP flow verify do potwierdzenia wzmocnienia NSG. Skonfiguruj przechwytywanie pakietów na żądanie na maszynach wirtualnych API do analizy sporadycznych przekroczeń limitu czasu. Dlaczego: Dedykowane narzędzia diagnostyczne szybko izolują problemy z routingiem/NSG i dostarczają dowodów na poziomie pakietów w razie potrzeby.
Utwórz alerty Azure Service Health dla dwóch regionów i usług objętych zakresem (App Service, SQL, Storage, Key Vault, Front Door). Skieruj je do tych samych grup akcji i dołącz listy dystrybucyjne kierownictwa dla powiadomień o planowanej konserwacji. Dlaczego: Proaktywna świadomość incydentów platformy i konserwacji zapobiega niespodziewanym awariom i umożliwia skoordynowaną komunikację.
To zintegrowane podejście zapewnia, że firma Adobe osiąga swoje cele RPO/RTO, szybko przywraca system po ataku ransomware lub błędzie operatora, wykrywa i usuwa anomalie w ciągu kilku minut oraz może jednoznacznie rozwiązywać problemy ze ścieżkami sieciowymi, pozostając na bieżąco z informacjami o zdarzeniach na platformie Azure.
← Bazy danych Azure i usługi danych · Wszystkie domeny · Bezpieczeństwo Azure i zgodność →
Przećwicz te pytania → · Testy na czas na ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Zdaj egzamin →