Microsoft AZ-305: Wysoka dostępność, odzyskiwanie po awarii i ciągłość działania biznesu — Przewodnik do nauki
Część Microsoft Azure Solutions Architect Expert AZ-305 — Przewodnik do nauki. Ćwicz ze zweryfikowanymi odpowiedziami w centrum egzaminów Microsoft, albo rozwiąż testy na czas na ExamRoll.io.
Przegląd
Wysoka dostępność (HA), odzyskiwanie po awarii (DR) i ciągłość biznesowa (BC) w Azure wymagają przemyślanego projektu na warstwach obliczeniowej, danych i sieciowej. Odporność zaczyna się od jasno zdefiniowanych celów czasu odzyskiwania (RTO) i punktu odzyskiwania (RPO), a następnie łączy możliwości platformy — strefy dostępności (Availability Zones), globalny routing, replikację danych, kopie zapasowe i orkiestrację przełączania awaryjnego — w przetestowaną, zautomatyzowaną strategię. Azure zapewnia izolację awarii na poziomie stref i regionów, globalną dystrybucję opartą na DNS i anycast, trwałość danych w wielu regionach oraz tworzenie i przywracanie kopii zapasowych sterowane przez polityki, aby sprostać rygorystycznym celom przy jednoczesnej kontroli kosztów i złożoności operacyjnej.
Architektura oparta na RTO/RPO oraz odporność strefowa i globalna
Projektowanie rozpoczyna się od RTO i RPO. RTO określa, jak szybko usługa musi zostać wznowiona po awarii; RPO określa maksymalną dopuszczalną utratę danych. Osiągnięcie niskiego RTO wymaga zautomatyzowanego przełączania awaryjnego i wstępnie alokowanych zasobów; osiągnięcie niskiego RPO wymaga synchronicznej lub niemal synchronicznej replikacji oraz częstych, spójnych punktów odzyskiwania.
Strefy dostępności (Availability Zones) to niezależne domeny awarii centrów danych w obrębie jednego regionu. Usługi strefowe (np. Virtual Machines, dyski zarządzane, publiczne adresy IP w warstwie Standard) są przypisane do jednej strefy. Usługi strefowo redundantne (np. frontony strefowo redundantne w Azure Load Balancer Standard, oferty magazynu strefowo redundantnego i strefowo redundantne warstwy Azure SQL) automatycznie obejmują wiele stref. Typowy wzorzec odporności polega na wdrożeniu strefowych maszyn wirtualnych w co najmniej dwóch strefach, umieszczeniu ich w jednej sieci wirtualnej i udostępnieniu strefowo redundantnego frontonu równoważenia obciążenia. Eliminuje to awarię pojedynczej strefy jako przyczynę przestoju.
Na globalnej krawędzi sieci wybierz między dystrybucją obciążenia opartą na DNS a opartą na proxy anycast:
- Azure Traffic Manager działa w oparciu o DNS. Kieruje klientów do punktów końcowych przy użyciu metod routingu: Wydajność (Performance - najniższe opóźnienie), Ważony (Weighted - testy A/B i stopniowe przenoszenie ruchu), Priorytet (Priority - przełączanie awaryjne active/passive), Geograficzny (Geographic - obsługa użytkowników z punktów końcowych zgodnych z regionalnymi regulacjami), Wielowartościowy (MultiValue - zwraca wiele prawidłowych rekordów IPv4/IPv6 dla prostych klientów) oraz Podsieć (Subnet - mapowanie zakresów IP klientów na określone punkty końcowe). Ponieważ działa w oparciu o DNS, Traffic Manager nie przyspiesza treści ani nie pośredniczy w ruchu; klienci łączą się bezpośrednio z wybranym punktem końcowym i podlegają lokalnemu zachowaniu buforowania DNS.
- Azure Front Door (Standard/Premium) to globalny odwrotny serwer proxy anycast dla HTTP/HTTPS z inteligentnym routingiem, odciążaniem TLS i zintegrowaną zaporą aplikacji internetowych (WAF). Reguły routingu dopasowują ruch na podstawie domeny, ścieżki, metody i nagłówków, a następnie kierują go do grup źródeł (origin groups); akcje silnika reguł mogą przepisywać adresy URL/nagłówki i wymuszać przekierowania. Sondy kondycji (health probes) stale oceniają stan źródła na konfigurowalnej ścieżce i protokole; niezdrowe źródła są usuwane z rotacji. Grupy źródeł (origin groups) obsługują dystrybucję priorytetową (active/passive) i ważoną między regionami. Polityki WAF są dołączane na poziomie punktu końcowego lub trasy, z zarządzanymi zestawami reguł, regułami niestandardowymi i ograniczaniem szybkości (rate limiting) w celu łagodzenia zagrożeń OWASP i ochrony przed złośliwymi klientami. Używaj Front Door, gdy potrzebujesz globalnego równoważenia obciążenia z przyspieszeniem, bezpieczeństwem na krawędzi sieci i przełączaniem awaryjnym świadomym aplikacji; łącz go z Traffic Manager tylko wtedy, gdy potrzebujesz punktów końcowych innych niż HTTP lub kontroli na poziomie DNS.
Na warstwie 4, Azure Load Balancer zapewnia dystrybucję obciążenia TCP/UDP z bardzo niskim opóźnieniem. Standard Load Balancer obsługuje frontony strefowe i strefowo redundantne, porty HA, reguły ruchu wychodzącego (outbound rules) i domyślnie bezpieczne zachowanie (wymaga jawnej konfiguracji NSG i puli zaplecza). Sondy kondycji (TCP/HTTP) określają stan zaplecza; w przypadku awarii instancje są usuwane z rotacji. Basic Load Balancer nie ma świadomości stref, zaawansowanych funkcji ani umowy SLA — należy go unikać w środowiskach produkcyjnych. Cross-region Load Balancer dodaje globalny fronton anycast, który równoważy obciążenie między regionalnymi usługami Standard Load Balancer, umożliwiając projekty wieloregionalne active/active dla obciążeń innych niż HTTP i zapewniając szybkie regionalne przełączanie awaryjne w oparciu o stan kondycji.
Ochrona danych i odzyskiwanie po awarii: Azure Backup i Site Recovery
Azure Backup zapewnia odzyskiwanie do punktu w czasie; Azure Site Recovery (ASR) zapewnia replikację obciążeń i zorkiestrowane przełączanie awaryjne. Usługi te odpowiadają na uzupełniające się potrzeby i są często używane razem.
Opcje magazynu Azure Backup:
- Magazyn Recovery Services chroni maszyny wirtualne Azure, SQL Server na maszynach wirtualnych Azure, SAP HANA na maszynach wirtualnych Azure, Azure Files oraz agentów MARS/MABS. Integruje się z zasadami kopii zapasowych (Backup policies), które definiują harmonogramy, retencję i spójne z aplikacją kopie zapasowe, jeśli są obsługiwane.
- Magazyn Backup to zmodernizowany magazyn dla nowszych obciążeń, takich jak kopie zapasowe Azure Disks i Azure Blobs, oferujący szczegółowe uprawnienia RBAC i strefowo nadmiarowy magazyn w obsługiwanych regionach. Wybierz typ magazynu dopasowany do obciążenia i modelu ładu korporacyjnego.
Zasady kopii zapasowych (Backup policies) określają, kiedy uruchamiane są kopie zapasowe, ich warstwy retencji (dzienna/tygodniowa/miesięczna/roczna) oraz ustawienia spójności. Usuwanie nietrwałe (soft delete) dodaje okno bezpieczeństwa, w którym usunięte elementy kopii zapasowej można przywrócić, chroniąc przed przypadkowym lub złośliwym usunięciem. Przywracanie międzyregionalne (cross-region restore) umożliwia odzyskiwanie danych z regionu pomocniczego, gdy magazyn używa opcji geonadmiarowych; funkcja ta musi być włączona i zależy od regionalnego wsparcia dla funkcji oraz gotowości płaszczyzny danych.
Azure Site Recovery replikuje obciążenia między strefami lub regionami i orkiestruje kompleksowe odzyskiwanie po awarii (DR):
- Zasady replikacji (Replication policies) definiują częstotliwość migawek, retencję punktów odzyskiwania, częstotliwość spójnych z aplikacją migawek oraz progi alertów RPO. Zasady te równoważą przepustowość replikacji, koszty magazynowania i precyzję odzyskiwania.
- Plany odzyskiwania (Recovery plans) zapewniają uporządkowane przełączanie awaryjne aplikacji wielowarstwowych z grupami (np. baza danych, API, warstwa webowa), krokami przed i po przełączeniu oraz automatyzacją za pomocą elementów runbook Azure Automation, skryptów lub działań ręcznych. W planie należy uwzględnić zmiany DNS, aktualizacje punktów końcowych Traffic Manager/Front Door oraz konfigurację aplikacji.
- Testowe przełączanie awaryjne (test failover) uruchamia izolowane odzyskiwanie przy użyciu nieprodukcyjnej sieci VNet lub sieci testowej w celu weryfikacji elementów runbook, kolejności uruchamiania i kondycji aplikacji bez wpływu na środowisko produkcyjne lub replikację. Regularne testowanie jest kluczowe do walidacji RTO.
- Powrót po awarii (failback) przywraca obciążenia do pierwotnej lokalizacji lub regionu, gdy jest to bezpieczne. Po przełączeniu awaryjnym należy ponownie zabezpieczyć obciążenie w nowym kierunku podstawowym, zsynchronizować zmiany, zaplanować okno powrotu po awarii i zweryfikować replikację po powrocie. W scenariuszach Azure-to-Azure zazwyczaj wykonuje się przełączenie awaryjne między sparowanymi regionami i odwraca replikację, aby przywrócić pierwotną topologię, gdy wszystko jest gotowe.
Ciągłość warstwy danych: Azure SQL, replikacja magazynu i Cosmos DB
Każda usługa danych oferuje odmienną semantykę trwałości i przełączania awaryjnego, która musi być zgodna z wymaganiami aplikacji dotyczącymi spójności.
Azure SQL Database i Azure SQL Managed Instance:
- Aktywna georeplikacja (Active geo-replication) tworzy do czterech odczytywalnych replik pomocniczych dla pojedynczych baz danych lub pul elastycznych. Oferuje replikację na poziomie bazy danych z ręcznym lub sterowanym przez API przełączaniem awaryjnym, umożliwiając skalowanie odczytu i odzyskiwanie po awarii (DR). Jest odpowiednia, gdy potrzebna jest kontrola na poziomie pojedynczej bazy danych i niestandardowa orkiestracja.
- Grupy automatycznego przełączania awaryjnego (Auto-failover groups) tworzą grupę baz danych (lub całą wystąpienie zarządzane), które przełączają się awaryjnie razem z punktem końcowym odbiornika (listener endpoint). Upraszcza to przełączanie awaryjne między regionami i zarządzanie parametrami połączenia (connection string) oraz obsługuje automatyczne przełączanie po okresie prolongaty. Używaj grup przełączania awaryjnego dla aplikacji z wieloma bazami danych, które wymagają skoordynowanego przełączania awaryjnego i uproszczonej łączności klienta.
- Nadmiarowość strefowa (Zone redundancy) rozmieszcza repliki w różnych strefach w danym regionie, aby przetrwać awarie strefowe bez możliwości odzyskiwania międzyregionalnego. Włącz ją dla warstw usług, które ją obsługują, aby poprawić lokalną dostępność bez zmiany profili opóźnień.
Opcje replikacji Azure Storage:
- GRS (geo-redundant storage) replikuje dane asynchronicznie z regionu podstawowego (trzy kopie) do sparowanego regionu pomocniczego (trzy kopie). Podczas normalnej pracy operacje odczytu i zapisu są kierowane do regionu podstawowego.
- RA-GRS dodaje dostęp do odczytu do punktu końcowego w regionie pomocniczym dla scenariuszy takich jak raportowanie awaryjne lub analityka, gdy region podstawowy ma obniżoną wydajność.
- GZRS (geo-zone-redundant storage) łączy ZRS w regionie podstawowym w celu zapewnienia trwałości strefowej z asynchroniczną replikacją do regionu pomocniczego, poprawiając zarówno odporność lokalną, jak i regionalną.
- RA-GZRS dodaje dostęp do odczytu do regionu pomocniczego dla kont GZRS. Jeśli region podstawowy jest nieodwracalny, można zainicjować przełączenie awaryjne konta do regionu pomocniczego. Po przełączeniu awaryjnym konto magazynu staje się podstawowe w regionie pomocniczym i zazwyczaj powraca do trybu lokalnie nadmiarowego (dopóki nie zostanie ponownie skonfigurowane). Należy spodziewać się pewnego RPO (replikacja asynchroniczna); aplikacje powinny obsługiwać idempotentność i uzgadnianie danych po przełączeniu awaryjnym.
Azure Cosmos DB:
- Zapisy w wielu regionach (Multi-region writes) pozwalają na zapis do dowolnego skonfigurowanego regionu z zasadami rozwiązywania konfliktów (ostatni zapis wygrywa za pomocą wyznaczonej właściwości, strategii niestandardowej lub wielowzorcowej). Zmniejsza to opóźnienia zapisu i zwiększa dostępność.
- Automatyczne przełączanie awaryjne (Automatic failover) używa listy regionów z priorytetami, aby w przypadku awarii promować nowy region zapisu. W połączeniu z wybranymi poziomami spójności (od Strong do Eventual) zarządzasz kompromisem między dostępnością a spójnością.
- Umowy SLA obejmują dostępność, przepustowość, opóźnienia i spójność. Dzięki zapisom w wielu regionach, Cosmos DB oferuje dostępność do 99,999% zarówno dla odczytów, jak i zapisów, przy założeniu poprawnej konfiguracji wieloregionowej. Projektuj klientów używających SDK z wykrywaniem punktów końcowych i mechanizmami ponawiania prób, aby w pełni korzystać z tych gwarancji.
← Sieci i łączność · Wszystkie domeny · Architektura bezpieczeństwa i Zero Trust →
Przećwicz te pytania → · Testy na czas na ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Zdaj egzamin →