Microsoft AZ-140: Monitorowanie, diagnostyka i rozwiązywanie problemów — Przewodnik do nauki
Część Microsoft Azure Virtual Desktop Specialty AZ-140 — Przewodnik do nauki. Ćwicz ze zweryfikowanymi odpowiedziami w centrum egzaminów Microsoft, albo rozwiąż testy na czas na ExamRoll.io.
Przegląd
Monitorowanie, diagnostyka i rozwiązywanie problemów w Azure Virtual Desktop (AVD) łączą logi platformy na poziomie zasobów, telemetrię wewnątrz systemu gościa oraz analitykę, aby wcześnie wykrywać problemy, szybko izolować przyczyny źródłowe i weryfikować doświadczenie użytkownika. Solidna architektura wykorzystuje Azure Monitor, Log Analytics, Azure Monitor Agent, reguły zbierania danych i dedykowane skoroszyty, z proaktywnym alertowaniem o kondycji usługi i warunkach wpływających na użytkowników. Ta sekcja wyjaśnia, jak zaprojektować potok monitorowania, włączyć diagnostykę, zbierać odpowiednie dane z hostów sesji, analizować je za pomocą Kusto Query Language (KQL) i reagować na najczęstsze problemy operacyjne, w tym łączność klienta, awarie agenta AVD, problemy z profilami FSLogix i wąskie gardła zasobów.
Architektura Azure Monitor i Log Analytics dla AVD Insights
Azure Virtual Desktop Insights to rozwiązanie oparte na Azure Monitor Workbooks i Log Analytics, które koreluje logi zasobów platformy AVD z telemetrią systemu operacyjnego gościa, aby zapewnić widoki kondycji, pojemności i doświadczenia użytkownika. Jego skuteczność zależy od dwóch płaszczyzn danych:
- Logi platformy/zasobów z zasobów AVD (pule hostów, obszary robocze, grupy aplikacji i usługa AVD) za pośrednictwem ustawień diagnostycznych.
- Telemetria gościa z hostów sesji za pośrednictwem Azure Monitor Agent (AMA) i reguł zbierania danych (DCR), w tym dzienniki zdarzeń systemu Windows i liczniki wydajności.
Architektura i zagadnienia projektowe dotyczące obszaru roboczego:
- Scentralizowane a dedykowane obszary robocze dla stref docelowych: Pojedynczy, bliski regionalnie obszar roboczy upraszcza zapytania, alertowanie i zarządzanie. Bardzo duże środowiska lub rygorystyczne wymagania dotyczące suwerenności danych mogą uzasadniać posiadanie wielu obszarów roboczych. Unikaj niepotrzebnego pozyskiwania danych między regionami ze względu na opóźnienia i koszty.
- Przechowywanie danych i koszty: Dostosuj okres przechowywania do swoich okien czasowych dochodzeń i potrzeb regulacyjnych. Typowy operacyjny okres przechowywania wynosi 30–90 dni, z archiwizacją w usłudze storage w celu długoterminowego przechowywania. Włącz logi podstawowe (basic logs) tylko w stosownych przypadkach; logi diagnostyczne AVD najlepiej sprawdzają się jako logi analityczne (analytics logs) ze względu na wydajność zapytań.
- Wielodostępność/wiele subskrypcji: Użyj dostępu zorientowanego na zasoby w Azure Monitor i Azure RBAC, aby przyznać zespołom operacyjnym uprawnienia do zapytań o ograniczonym zakresie. W razie potrzeby przesyłaj strumieniowo logi do Event Hubs dla systemów SIEM.
- Widoczność zależności: Włącz VM insights lub zbieraj liczniki wydajności, aby korelować dane dotyczące procesora, pamięci, dysku i sieci z danymi sesji i połączeń AVD.
Skoroszyty AVD Insights opierają się zarówno na ustawieniach diagnostycznych, jak i na telemetrii wewnątrz gościa; jeśli brakuje któregokolwiek z tych elementów, wizualizacje będą niekompletne.
Włączanie diagnostyki i zbieranie telemetrii
Ustawienia diagnostyczne na zasobach AVD
Włącz ustawienia diagnostyczne dla każdego z poniższych typów zasobów i wysyłaj dane do swojego obszaru roboczego Log Analytics. Opcjonalnie archiwizuj je w usłudze storage w celu długoterminowego przechowywania i przesyłaj strumieniowo do Event Hubs w celu zewnętrznej analityki.
- Pule hostów: Włącz kategorie takie jak Connection, HostRegistration, Checkpoint, Management, Error i NetworkData. Rejestrują one próby połączeń, zmiany stanu rejestracji agenta, punkty kontrolne sesji i operacje zarządzania.
- Grupy aplikacji i obszary robocze: Włącz kategorie Management i Error, aby rejestrować publikowanie kanałów, przypisania i zmiany konfiguracji.
- Logi na poziomie usługi AVD: Tam, gdzie to możliwe, włącz kategorie Error i Management, aby uzyskać wgląd w operacje usługi istotne dla Twojego tenanta.
Agent Azure Monitor i reguły DCR na hostach sesji
- Wybór agenta: Użyj agenta Azure Monitor Agent (AMA). Starszy agent Log Analytics (MMA) jest przestarzały i powinien zostać usunięty, aby uniknąć duplikacji i nieporozumień.
- Reguły Zbierania Danych (DCR): Utwórz reguły DCR, aby zbierać:
- Dzienniki zdarzeń systemu Windows:
- Microsoft-Windows-RemoteDesktopServices-RdpCoreTS/Operational
- Microsoft-Windows-TerminalServices-LocalSessionManager/Operational
- Microsoft-Windows-TerminalServices-RemoteConnectionManager/Operational
- Microsoft-FSLogix-Apps/Operational i Admin
- System i Application (dla zdarzeń dotyczących rdzenia systemu operacyjnego, sieci, VSS, SMB, magazynu i profili)
- Liczniki wydajności:
- Processor(_Total)% Processor Time
- System\Processor Queue Length
- Memory\Available MBytes, Memory\Committed Bytes
- LogicalDisk(_Total)\Avg. Disk sec/Read, Avg. Disk sec/Write, Disk Transfers/sec, Free Megabytes
- Network Interface(*)\Bytes Total/sec, Output Queue Length
- Terminal Services\Active Sessions, Inactive Sessions, Total Sessions
- RemoteFX Graphics(*)\Frames Skipped/Second (server, network, client)
- Sygnał pulsu (Heartbeat, włączony przez AMA) do sprawdzania aktywności hosta.
- Dzienniki zdarzeń systemu Windows:
- Zakres i zarządzanie: Przypisz reguły DCR do grup zasobów pul hostów lub do dynamicznych zakresów maszyn wirtualnych za pomocą tagów. Unikaj nakładających się reguł DCR, które zbierają te same liczniki lub kanały zdarzeń, aby zapobiec duplikacji danych i nadmiernym kosztom.
- VM insights: Opcjonalnie włącz VM insights, aby uzyskać dedykowane widoki wydajności i zależności; wypełnia to również tabelę InsightsMetrics, umożliwiając bogatszą analizę trendów wydajności.
Analiza operacyjna i techniki rozwiązywania problemów
Skoroszyty i pulpity nawigacyjne
- Użyj skoroszytów AVD Insights, aby uzyskać wyselekcjonowany przegląd: wskaźniki pomyślnych/nieudanych połączeń, rozkład sesji, stan rejestracji hostów i wydajność hostów sesji. Twórz niestandardowe skoroszyty dla jednostek biznesowych lub pul hostów z kluczowymi wskaźnikami wydajności (KPI) dostosowanymi do umów SLA (na przykład, czas do wykrycia pierwszej awarii, wskaźniki zastępcze czasu trwania logowania, gęstość sesji).
Zapytania Kusto do typowych dochodzeń
- Nieudane połączenia według etapu i komunikatu:
AzureDiagnostics
| where Category == "Connection"
| extend p = parse_json(Properties)
| summarize Attempts = count(), Failures = countif(tostring(p.Status) != "Success")
by FailureStage = tostring(p.FailureStage),
FailureMessage = tostring(p.FailureMessage)
| order by Failures desc
- Liczba sesji na hosta i obciążenie pojemności:
Perf
| where ObjectName == "Terminal Services" and CounterName in ("Active Sessions","Total Sessions")
| summarize Avg=count(), AvgValue=avg(CounterValue) by bin(TimeGenerated, 5m), Computer, CounterName
- Kondycja rejestracji agenta:
AzureDiagnostics
| where Category == "HostRegistration"
| extend p = parse_json(Properties)
| summarize Latest = arg_max(TimeGenerated, tostring(p.RegistrationState), tostring(p.Details))
by ResourceId
| where Latest_RegistrationState != "Registered"
- Wykrywanie wysokiego użycia procesora CPU:
Perf
| where ObjectName == "Processor" and CounterName == "% Processor Time" and InstanceName == "_Total"
| summarize AvgCPU = avg(CounterValue) by Computer, bin(TimeGenerated, 5m)
| where AvgCPU > 85
- Błędy FSLogix:
Event
| where Source == "Microsoft-FSLogix-Apps"
| project TimeGenerated, Computer, EventID, RenderedDescription
| order by TimeGenerated desc
Diagnostyka połączeń i typowe problemy z klientem
- Etapy do zweryfikowania:
- Odnajdowanie źródła (feed discovery): Pobranie obszaru roboczego (Workspace) wymaga dostępu do internetu i pomyślnego uwierzytelnienia w Azure AD. Dostęp warunkowy (Conditional Access) lub niezgodność czasu mogą blokować pozyskanie tokenu; zweryfikuj zasady zgodności urządzeń i synchronizację NTP.
- Negocjacje z brokerem i bramą: Upewnij się, że ruch wychodzący na porcie TCP 443 do punktów końcowych usługi AVD jest dozwolony przez zapory sieciowe i serwery proxy. Inspekcja SSL może zrywać połączenia WebSocket; wyklucz punkty końcowe AVD z przechwytywania.
- Transport RDP: Gdy RDP Shortpath dla sieci publicznych lub zarządzanych jest włączony, zezwól na ruch UDP na porcie 3390 zgodnie z projektem. Jeśli jest zablokowany, klienci przełączają się na protokół TCP, co może pogorszyć doświadczenie użytkownika.
- Objawy i przyczyny:
- Częste rozłączenia lub słaba jakość wideo: Zablokowany port UDP lub wysoka utrata pakietów; zweryfikuj QoS i przepustowość sieci WAN, nadaj priorytet ruchowi w czasie rzeczywistym.
- „Brak dostępnych zasobów”: Rejestracja hosta nie powiodła się lub pojemność została wyczerpana; potwierdź kondycję agenta i limity sesji.
- Powolne logowania: Opóźnienia w dołączaniu kontenera profilu, przetwarzanie GPO lub skanowanie antywirusowe w czasie rzeczywistym na ścieżkach profili.
Dzienniki zdarzeń systemu Windows, komponenty pulpitu zdalnego i agent AVD
- Kluczowe usługi: Remote Desktop Services (TermService), Remote Desktop Services Infrastructure Agent (RdAgent) oraz Remote Desktop Agent Loader (RDAgentBootLoader).
- Logi agenta na dysku: C:\ProgramData\Microsoft\RDInfra\RDAgent\Logs i C:\ProgramData\Microsoft\RDInfra\RDAgentBootLoader\Logs.
- Istotne kanały zdarzeń:
- RdpCoreTS/Operational dla błędów transportu i protokołu.
- TerminalServices-LocalSessionManager/Operational dla cyklu życia sesji.
- TerminalServices-RemoteConnectionManager/Operational dla autoryzacji połączeń i brokeringu.
- Rozwiązywanie problemów z rejestracją agenta:
- Sprawdź DNS, synchronizację czasu i ruch wychodzący na porcie 443.
- Upewnij się, że host sesji może rozwiązywać nazwy i docierać do punktów końcowych usługi AVD.
- Wygeneruj ponownie i zastosuj aktualny token rejestracyjny, jeśli host został wdrożony ręcznie, a token wygasł.
Logi FSLogix i rozwiązywanie problemów z profilami
- Logi: C:\ProgramData\FSLogix\Logs\Profile*.log oraz Podgląd zdarzeń (Event Viewer) w gałęzi Microsoft-FSLogix-Apps.
- Typowe tryby awarii:
- Odmowa dostępu lub naruszenie zasad udostępniania na pliku VHD(X): Popraw uprawnienia udziału i listy ACL systemu plików NTFS; upewnij się, że istnieje tylko jedna aktywna sesja na profil użytkownika, jeśli nakładanie się wielu sesji nie jest dozwolone.
- Dysk pełny lub skoki opóźnień: Monitoruj pojemność pamięci masowej i liczbę operacji IOPS. Pamięć masowa w warstwie Premium lub usługa Azure NetApp Files są często wymagane w przypadku dużych środowisk o intensywnym wykorzystaniu IOPS.
- Cloud Cache: Przejrzyj CCDLocations i pojemność dysku pamięci podręcznej; niestabilność sieci WAN może wydłużyć czas logowania.
- Najlepsze praktyki:
- Wyklucz ścieżki dołączania plików VHD(X) ze skanowania antywirusowego przy dostępie (on-access).
- Użyj pliku redirections.xml, aby utrzymać duże, niestabilne foldery poza kontenerem profilu.
- Zweryfikuj działanie protokołu Kerberos dla uwierzytelniania Azure Files w AD DS; wpisy DNS i nazwy SPN muszą być poprawne.
Analiza procesora CPU, pamięci, dysku i sieci
- CPU: Wysoki wskaźnik % Processor Time z utrzymującą się wartością System\Processor Queue Length > 2 na vCPU wskazuje na rywalizację o zasoby procesora. Zwiększ liczbę vCPU lub zmniejsz gęstość sesji.
- Pamięć: Niski poziom Memory\Available MBytes i wysokie stronicowanie (Memory\Pages/sec) powodują zacięcia; dodaj pamięć RAM lub zmniejsz gęstość sesji. Obserwuj limit alokacji (commit limit) i zestawy robocze (working sets) wymagających aplikacji.
- Dysk: Progi opóźnień wynoszą zazwyczaj < 5–10 ms dla odczytów/zapisów na ścieżkach profili i tymczasowych; monitoruj LogicalDisk\Avg. Disk sec/Read i Write. Niedopasowanie klasy pamięci masowej objawia się długim logowaniem i powolnym działaniem operacji I/O aplikacji.
- Sieć: Wskaźniki Network Interface\Bytes Total/sec i Output Queue Length pokazują nasycenie. Wysoka liczba retransmisji TCP i utrata pakietów pogarszają jakość RDP; potwierdź priorytetyzację QoS dla ruchu AVD.
Proaktywne pulpity nawigacyjne, alerty i kondycja usługi
- Pulpity nawigacyjne: Publikuj skoroszyty (workbooks) pokazujące zagęszczenie sesji na hosta w porównaniu ze skonfigurowanym maksimum, liczbę stanów agenta (Zarejestrowany vs. Niezarejestrowany), najczęstsze komunikaty o błędach połączeń i mapy cieplne wydajności.
- Alerty:
- Błędy rejestracji:
AzureDiagnostics
| where Category == "HostRegistration"
| extend p = parse_json(Properties)
| where tostring(p.RegistrationState) != "Registered"
- Obciążenie pojemności (przykładowy próg: średnia liczba aktywnych sesji mniejsza o 1 od limitu hosta przez 10 minut):
Perf
| where ObjectName == "Terminal Services" and CounterName == "Active Sessions"
| summarize AvgActive = avg(CounterValue) by Computer, bin(TimeGenerated, 10m)
| join kind=leftouter (
// Replace 20 with your per-host maximum sessions
datatable(Computer:string, MaxSessions:int) [
// Populate from CMDB or tag-driven mapping
]
) on Computer
| where AvgActive >= MaxSessions - 1
- Zdarzenia wpływające na użytkownika: Uruchamiaj w przypadku nagłych wzrostów liczby błędów połączeń, błędów dołączania FSLogix lub czasu trwania logowania, gdy są one dostępne we właściwościach połączenia AVD.
- Rywalizacja o zasoby: Alertuj przy utrzymującym się użyciu procesora > 85%, dostępnej pamięci (Memory\Available MBytes) < 500 MB, średnim czasie zapisu/odczytu dysku (Disk Avg. sec/Write or Read) > 20 ms.
- Grupy akcji: Kieruj alerty do poczty e-mail, Teams, systemów ITSM, elementów runbook usługi Automation lub Functions w celu automatycznego skalowania lub naprawy.
- Kondycja usługi: Skonfiguruj alerty Azure Service Health dla usług Azure Virtual Desktop, Storage, Azure Files, Azure NetApp Files i Azure AD, aby dowiedzieć się o awariach lub pracach konserwacyjnych, które mogą wpłynąć na logowanie, profile lub sesje, zanim zrobią to użytkownicy.
Praktyczny scenariusz problemu
Firma Adobe Inc. zgłasza sporadyczne rozłączenia sesji Azure Virtual Desktop i długie czasy logowania w godzinach szczytu dla puli hostów współdzielonych z systemem Windows 11 Enterprise (multi-session) korzystającej z FSLogix na Azure Files Premium.
- Weryfikacja wymagań wstępnych dotyczących usług i sieci
- Dlaczego: Wyklucza to zewnętrzne przyczyny, których nie można rozwiązać poprzez naprawę hosta.
- Działania:
- Sprawdź Azure Service Health pod kątem incydentów w regionie docelowym, które wpływają na Desktop Virtualization lub Storage.
- Potwierdź, że zapory sieciowe w oddziałach zezwalają na ruch wychodzący TCP 443 i nie dokonują inspekcji SSL punktów końcowych AVD; zweryfikuj, czy UDP 3390 jest dozwolony, aby poprawić jakość RDP za pomocą Shortpath, jeśli ma to zastosowanie.
- Walidacja potoku diagnostycznego
- Dlaczego: AVD Insights wymaga zarówno logów zasobów, jak i telemetrii z systemu gościa (in-guest), aby skorelować awarie z wąskimi gardłami zasobów.
- Działania:
- Upewnij się, że ustawienia diagnostyczne są włączone dla puli hostów, obszaru roboczego i grup aplikacji, z kategoriami Connection, HostRegistration, Checkpoint, Management, Error i NetworkData kierowanymi do centralnego obszaru roboczego Log Analytics.
- Potwierdź, że agent AMA jest zainstalowany na wszystkich hostach sesji, a reguła DCR zbiera dzienniki zdarzeń i liczniki wydajności związane z RDP.
- Analiza błędów połączeń i kondycji agenta
- Dlaczego: Częste rozłączenia często korelują z przejściem na transport zapasowy (transport fallback) lub niestabilnością rejestracji agenta.
- Działania:
- Uruchom zapytania AVD Connection, aby zidentyfikować etapy i komunikaty o błędach; wyizoluj błędy związane z proxy lub tokenem.
- Wykonaj zapytanie do HostRegistration, aby znaleźć niezarejestrowane hosty (Unregistered); jeśli istnieją, zrestartuj usługi RDAgentBootLoader i RdAgent, zweryfikuj DNS i synchronizację czasu, a następnie ponownie zarejestruj hosty, jeśli tokeny rejestracyjne wygasły.
- Badanie opóźnień logowania i problemów z dołączaniem profili FSLogix
- Dlaczego: Operacje na profilach są główną przyczyną długich czasów logowania.
- Działania:
- Przejrzyj logi Microsoft-FSLogix-Apps w poszukiwaniu błędów odmowy dostępu (access denied), naruszeń udostępniania (sharing violations) lub przekroczeń czasu montowania (mount timeouts); zweryfikuj listy ACL udziału i systemu plików NTFS oraz wyklucz ścieżki VHD(X) ze skanowania antywirusowego.
- Sprawdź metryki Azure Files Premium i liczniki wydajności maszyny wirtualnej pod kątem opóźnień dysku; zwiększ przepustowość udziału plików lub zmigruj profile do Azure NetApp Files, jeśli liczba operacji IOPS stale przekracza pojemność.
- Identyfikacja wąskich gardeł zasobów i obciążenia pojemności
- Dlaczego: Przeciążone hosty powodują zarówno degradację wydajności, jak i objawy rozłączeń w warunkach rywalizacji o zasoby.
- Działania:
- Użyj liczników wydajności (Perf counters), aby wykryć utrzymujące się użycie procesora > 85%, niską dostępną pamięć lub wysokie opóźnienia dysku; zmniejsz limity sesji na hosta lub skaluj w poziomie (scale out) liczbę hostów.
- Włącz lub dostosuj automatyczne skalowanie, aby dodawać pojemność przed szczytem obciążenia; zweryfikuj działanie trybu opróżniania (drain mode), aby chronić aktywne sesje podczas skalowania w dół (scale-in).
- Wdrożenie proaktywnych alertów i pulpitów nawigacyjnych
- Dlaczego: Zapobiegaj ponownemu występowaniu problemu poprzez wykrywanie wczesnych sygnałów ostrzegawczych.
- Działania:
- Utwórz alerty dla stanu HostRegistration ‘Not Registered’, rosnącej liczby błędów połączeń (Connection failures) i nagłych wzrostów błędów FSLogix.
- Zbuduj pulpit nawigacyjny pojemności pokazujący aktywne sesje w porównaniu z maksimum na hosta oraz mapy cieplne zasobów; udostępnij go zespołom operacyjnym i właścicielom usług.
To podejście łączy Azure Service Health do monitorowania zależności zewnętrznych, ustawienia diagnostyczne dla wglądu w platformę, AMA+DCR dla telemetrii hosta, analizę opartą na KQL do izolowania domen awarii oraz ukierunkowane działania naprawcze w obszarach sieci, kondycji agenta, profili i pojemności — zapewniając, że firma Adobe Inc. ustabilizuje doświadczenie użytkownika i zapobiegnie przyszłym regresjom.
← Bezpieczeństwo · Wszystkie domeny · Odporność →
Przećwicz te pytania → · Testy na czas na ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Zdaj egzamin →