Microsoft AZ-140: Monitoraggio, diagnostica e risoluzione dei problemi — Guida allo studio
Fa parte della Microsoft Azure Virtual Desktop Specialty AZ-140 — Guida allo studio. Esercitati con risposte verificate nel centro esami Microsoft, oppure fai test cronometrati su ExamRoll.io.
Panoramica
Il monitoraggio, la diagnostica e la risoluzione dei problemi in Azure Virtual Desktop (AVD) combinano log della piattaforma a livello di risorsa, telemetria in-guest e analisi per rilevare precocemente i problemi, isolare rapidamente le cause principali e convalidare l’esperienza utente. Un’architettura solida utilizza Azure Monitor, Log Analytics, Azure Monitor Agent, regole di raccolta dati e cartelle di lavoro curate, con avvisi proattivi sullo stato del servizio e sulle condizioni che impattano gli utenti. Questa sezione spiega come progettare la pipeline di monitoraggio, abilitare la diagnostica, raccogliere i dati corretti dagli host di sessione, analizzarli con Kusto Query Language (KQL) e rispondere ai problemi operativi più comuni, tra cui la connettività dei client, i guasti dell’agente AVD, i problemi con i profili FSLogix e i colli di bottiglia delle risorse.
Architettura di Azure Monitor e Log Analytics per AVD Insights
Azure Virtual Desktop Insights è una soluzione basata su Azure Monitor Workbooks e Log Analytics che correla i log delle risorse della piattaforma AVD con la telemetria del sistema operativo guest per fornire viste sullo stato di salute, sulla capacità e sull’esperienza utente. La sua efficacia dipende da due piani di dati:
- Log della piattaforma/risorse provenienti dalle risorse AVD (pool di host, aree di lavoro, gruppi di applicazioni e il servizio AVD) tramite le impostazioni di diagnostica.
- Telemetria guest dagli host di sessione tramite Azure Monitor Agent (AMA) e Data Collection Rules (DCR), inclusi i registri eventi di Windows e i contatori delle prestazioni.
Architettura dell’area di lavoro e considerazioni di progettazione:
- Aree di lavoro centralizzate o per landing zone: un’unica area di lavoro, vicina a livello regionale, semplifica le query, gli avvisi e la governance. Infrastrutture molto grandi o requisiti stringenti sulla sovranità dei dati possono giustificare l’uso di più aree di lavoro. Evitare l’ingestione di dati tra diverse regioni, se non necessaria, a causa della latenza e dei costi.
- Conservazione dei dati e costi: dimensionare la conservazione in base alle finestre temporali di indagine e ai requisiti normativi. La conservazione operativa tipica è di 30-90 giorni, con archiviazione su storage per il lungo termine. Abilitare i log di base solo se appropriato; i log di diagnostica di AVD sono ottimali come log di analisi per le prestazioni delle query.
- Multi-tenant/multi-sottoscrizione: utilizzare l’accesso incentrato sulle risorse di Azure Monitor e Azure RBAC per concedere autorizzazioni di query con ambito limitato ai team operativi. Inviare i log in streaming a Event Hubs per l’integrazione con SIEM, quando necessario.
- Visibilità delle dipendenze: abilitare VM insights o raccogliere contatori delle prestazioni per correlare CPU, memoria, disco e rete con i dati di sessione e connessione di AVD.
Le cartelle di lavoro di AVD Insights si basano sia sulle impostazioni di diagnostica sia sulla telemetria in-guest; se uno dei due manca, le visualizzazioni saranno incomplete.
Abilitazione della diagnostica e raccolta della telemetria
Impostazioni di diagnostica sulle risorse AVD
Abilitare le impostazioni di diagnostica per ciascuno dei seguenti tipi di risorsa e inviarle alla propria area di lavoro Log Analytics. Opzionalmente, archiviare su uno storage account per la conservazione a lungo termine e inviare in streaming a Event Hubs per analisi esterne.
- Pool di host: abilitare categorie come Connection, HostRegistration, Checkpoint, Management, Error e NetworkData. Queste acquisiscono i tentativi di connessione, le modifiche dello stato di registrazione dell’agente, i checkpoint di sessione e le operazioni di gestione.
- Gruppi di applicazioni e aree di lavoro: abilitare Management ed Error per acquisire la pubblicazione dei feed, le assegnazioni e le modifiche di configurazione.
- Log a livello di servizio AVD: dove disponibili, abilitare Error e Management per ottenere visibilità sulle operazioni di servizio pertinenti per il proprio tenant.
Azure Monitor Agent e DCR sugli host di sessione
- Scelta dell’agente: utilizzare Azure Monitor Agent (AMA). L’agente legacy Log Analytics (MMA) è deprecato e dovrebbe essere rimosso per evitare duplicazioni e confusione.
- Regole di raccolta dati (DCR): creare DCR per raccogliere:
- Registri eventi di Windows:
- Microsoft-Windows-RemoteDesktopServices-RdpCoreTS/Operational
- Microsoft-Windows-TerminalServices-LocalSessionManager/Operational
- Microsoft-Windows-TerminalServices-RemoteConnectionManager/Operational
- Microsoft-FSLogix-Apps/Operational e Admin
- System e Application (per eventi del sistema operativo principale, di rete, VSS, SMB, storage e profilo)
- Contatori delle prestazioni:
- Processor(_Total)% Processor Time
- System\Processor Queue Length
- Memory\Available MBytes, Memory\Committed Bytes
- LogicalDisk(_Total)\Avg. Disk sec/Read, Avg. Disk sec/Write, Disk Transfers/sec, Free Megabytes
- Network Interface(*)\Bytes Total/sec, Output Queue Length
- Terminal Services\Active Sessions, Inactive Sessions, Total Sessions
- RemoteFX Graphics(*)\Frames Skipped/Second (server, network, client)
- Heartbeat (abilitato da AMA) per verificare l’attività dell’host.
- Registri eventi di Windows:
- Ambito e governance: assegnare le DCR ai gruppi di risorse dei pool di host o ad ambiti di VM dinamici utilizzando i tag. Evitare la sovrapposizione di DCR che raccolgono gli stessi contatori o canali di eventi per prevenire dati duplicati e costi eccessivi.
- VM insights: opzionalmente, abilitare VM insights per visualizzazioni curate sulle prestazioni e sulle dipendenze; popola anche la tabella InsightsMetrics per un’analisi più ricca dei trend prestazionali.
Analisi Operativa e Tecniche di Risoluzione dei Problemi
Cartelle di lavoro e dashboard
- Utilizzare le cartelle di lavoro di AVD Insights per una panoramica curata: tassi di successo/fallimento delle connessioni, distribuzione delle sessioni, stato di registrazione degli host e prestazioni degli host di sessione. Creare cartelle di lavoro personalizzate per unità aziendali o pool di host con indicatori chiave di prestazione (KPI) allineati agli SLA (ad esempio, tempo di rilevamento del primo errore, proxy della durata di accesso, densità di sessione).
Query Kusto per indagini comuni
- Errori di connessione per fase e messaggio:
AzureDiagnostics
| where Category == "Connection"
| extend p = parse_json(Properties)
| summarize Attempts = count(), Failures = countif(tostring(p.Status) != "Success")
by FailureStage = tostring(p.FailureStage),
FailureMessage = tostring(p.FailureMessage)
| order by Failures desc
- Conteggio delle sessioni per host e pressione sulla capacità:
Perf
| where ObjectName == "Terminal Services" and CounterName in ("Active Sessions","Total Sessions")
| summarize Avg=count(), AvgValue=avg(CounterValue) by bin(TimeGenerated, 5m), Computer, CounterName
- Stato di integrità della registrazione dell’agente:
AzureDiagnostics
| where Category == "HostRegistration"
| extend p = parse_json(Properties)
| summarize Latest = arg_max(TimeGenerated, tostring(p.RegistrationState), tostring(p.Details))
by ResourceId
| where Latest_RegistrationState != "Registered"
- Rilevamento di CPU elevata:
Perf
| where ObjectName == "Processor" and CounterName == "% Processor Time" and InstanceName == "_Total"
| summarize AvgCPU = avg(CounterValue) by Computer, bin(TimeGenerated, 5m)
| where AvgCPU > 85
- Errori di FSLogix:
Event
| where Source == "Microsoft-FSLogix-Apps"
| project TimeGenerated, Computer, EventID, RenderedDescription
| order by TimeGenerated desc
Diagnostica della connessione e problemi comuni del client
- Fasi da convalidare:
- Individuazione del feed: Il recupero dell’area di lavoro richiede accesso a Internet e un’autenticazione Azure AD riuscita. L’Accesso Condizionale o un disallineamento temporale possono bloccare l’acquisizione del token; verificare i criteri di conformità dei dispositivi e la sincronizzazione NTP.
- Negoziazione con broker e gateway: Assicurarsi che il traffico TCP 443 in uscita verso gli endpoint del servizio AVD sia consentito attraverso firewall e proxy. L’ispezione SSL può interrompere le connessioni WebSocket; escludere gli endpoint AVD dall’intercettazione.
- Trasporto RDP: Quando RDP Shortpath per reti pubbliche o gestite è abilitato, consentire UDP 3390 come previsto. Se bloccato, i client eseguono il fallback su TCP, il che può degradare l’esperienza utente.
- Sintomi e cause:
- Disconnessioni frequenti o video di scarsa qualità: UDP bloccato o perdita di pacchetti elevata; verificare la QoS e la capacità della WAN, dare priorità al traffico in tempo reale.
- “Nessuna risorsa disponibile”: Registrazione dell’host fallita o capacità esaurita; confermare lo stato di integrità dell’agente e i limiti di sessione.
- Accessi lenti: Ritardi nell’associazione del contenitore del profilo, elaborazione delle GPO o scansione antivirus in tempo reale sui percorsi dei profili.
Log eventi di Windows, componenti di Desktop Remoto e agente AVD
- Servizi chiave: Remote Desktop Services (TermService), Remote Desktop Services Infrastructure Agent (RdAgent) e Remote Desktop Agent Loader (RDAgentBootLoader).
- Log dell’agente su disco: C:\ProgramData\Microsoft\RDInfra\RDAgent\Logs e C:\ProgramData\Microsoft\RDInfra\RDAgentBootLoader\Logs.
- Canali di eventi pertinenti:
- RdpCoreTS/Operational per errori di trasporto e di protocollo.
- TerminalServices-LocalSessionManager/Operational per il ciclo di vita della sessione.
- TerminalServices-RemoteConnectionManager/Operational per l’autorizzazione e il brokering della connessione.
- Risoluzione dei problemi di registrazione dell’agente:
- Verificare DNS, sincronizzazione dell’ora e la porta 443 in uscita.
- Assicurarsi che l’host di sessione possa risolvere e raggiungere gli endpoint del servizio AVD.
- Rigenerare e applicare un token di registrazione valido se l’host è stato aggiunto manualmente e il token è scaduto.
Log di FSLogix e risoluzione dei problemi del profilo
- Log: C:\ProgramData\FSLogix\Logs\Profile*.log e Visualizzatore eventi sotto Microsoft-FSLogix-Apps.
- Modalità di errore comuni:
- Accesso negato o violazione di condivisione su VHD(X): Correggere le ACL di condivisione e NTFS; garantire una sola sessione attiva per profilo utente se la sovrapposizione di più sessioni non è consentita.
- Disco pieno o picchi di latenza: Monitorare la capacità di archiviazione e gli IOPS. Spesso sono richiesti file di tipo Premium o Azure NetApp Files per ambienti di grandi dimensioni e ad alta intensità di IOPS.
- Cloud Cache: Rivedere le CCDLocations e la capacità dell’unità di cache; l’instabilità della WAN può aumentare il tempo di accesso.
- Procedure consigliate:
- Escludere i percorsi di collegamento dei VHD(X) dalla scansione on-access dell’antivirus.
- Usare redirections.xml per mantenere le cartelle volatili di grandi dimensioni fuori dal contenitore del profilo.
- Convalidare Kerberos per l’autenticazione AD DS di Azure Files; DNS e SPN devono essere corretti.
Analisi di CPU, memoria, disco e rete
- CPU: Un valore elevato di % Processor Time con un System\Processor Queue Length sostenuto > 2 per vCPU indica contesa della CPU. Aumentare le vCPU o ridurre la densità di sessione.
- Memoria: Un basso valore di Memory\Available MBytes e un paging elevato (Memory\Pages/sec) causano blocchi; aggiungere RAM o ridurre la densità di sessione. Tenere d’occhio il limite di commit e i working set delle applicazioni pesanti.
- Disco: Le soglie di latenza sono tipicamente < 5–10 ms per letture/scritture sui percorsi dei profili e temporanei; monitorare LogicalDisk\Avg. Disk sec/Read e Write. Un disallineamento della classe di archiviazione si manifesta con accessi lunghi e I/O delle app lento.
- Rete: I contatori Network Interface\Bytes Total/sec e Output Queue Length mostrano la saturazione. Ritrasmissioni TCP elevate e perdita di pacchetti degradano la qualità RDP; confermare la prioritizzazione QoS per il traffico AVD.
Dashboard proattive, avvisi e integrità del servizio
- Dashboard: Pubblicare cartelle di lavoro che mostrino la densità di sessioni per host rispetto al massimo configurato, i conteggi dello stato degli agent (Registrato vs. Non registrato), i principali messaggi di errore di connessione e le mappe di calore delle prestazioni.
- Avvisi:
- Errori di registrazione:
AzureDiagnostics
| where Category == "HostRegistration"
| extend p = parse_json(Properties)
| where tostring(p.RegistrationState) != "Registered"
- Pressione sulla capacità (soglia di esempio: media delle sessioni attive entro 1 dal limite dell’host per 10 minuti):
Perf
| where ObjectName == "Terminal Services" and CounterName == "Active Sessions"
| summarize AvgActive = avg(CounterValue) by Computer, bin(TimeGenerated, 10m)
| join kind=leftouter (
// Replace 20 with your per-host maximum sessions
datatable(Computer:string, MaxSessions:int) [
// Populate from CMDB or tag-driven mapping
]
) on Computer
| where AvgActive >= MaxSessions - 1
- Eventi con impatto sull’utente: Attivare su picchi di errori di connessione, errori di collegamento di FSLogix o durate di accesso quando disponibili nelle proprietà di connessione di AVD.
- Contesa di risorse: Avvisare in caso di CPU costantemente > 85%, Memory\Available MBytes < 500 MB, Disk Avg. sec/Write o Read > 20 ms.
- Gruppi di azioni: Indirizzare gli avvisi a e-mail, Teams, ITSM, runbook di Automazione o Funzioni per la scalabilità automatica o la correzione.
- Integrità del servizio: Configurare gli avvisi di Azure Service Health per Azure Virtual Desktop, Storage, Azure Files, Azure NetApp Files e Azure AD per essere informati su interruzioni o manutenzioni che potrebbero influire su accessi, profili o sessioni prima che lo facciano gli utenti.
Scenario pratico di un problema
Adobe Inc. segnala disconnessioni intermittenti da Azure Virtual Desktop e accessi lenti durante le ore di punta per un pool di host multi-sessione condiviso con Windows 11 Enterprise che utilizza FSLogix su Azure Files Premium.
- Verificare i prerequisiti di servizio e di rete
- Perché: Esclude cause esterne che nessuna correzione sull’host può risolvere.
- Azioni:
- Controllare Azure Service Health per incidenti nella regione di destinazione che interessano Desktop Virtualization o Storage.
- Confermare che i firewall delle filiali consentano il traffico TCP 443 in uscita e non eseguano ispezione SSL sugli endpoint di AVD; verificare che il traffico UDP 3390 sia consentito per migliorare la qualità RDP tramite Shortpath, ove applicabile.
- Convalidare la pipeline di diagnostica
- Perché: AVD Insights richiede sia i log delle risorse sia la telemetria in-guest per correlare gli errori con i colli di bottiglia delle risorse.
- Azioni:
- Assicurarsi che le impostazioni di diagnostica siano abilitate per il pool di host, l’area di lavoro e i gruppi di applicazioni con le categorie Connection, HostRegistration, Checkpoint, Management, Error e NetworkData verso l’area di lavoro Log Analytics centrale.
- Confermare che l’AMA sia installato su tutti gli host di sessione e che la DCR stia raccogliendo i log degli eventi relativi a RDP e i contatori delle prestazioni.
- Analizzare gli errori di connessione e l’integrità dell’agent
- Perché: Le disconnessioni frequenti sono spesso correlate al fallback del trasporto o all’instabilità della registrazione dell’agent.
- Azioni:
- Eseguire query sulle connessioni di AVD per identificare le fasi e i messaggi di errore; isolare gli errori relativi a proxy o token.
- Eseguire query su HostRegistration per trovare host non registrati (Unregistered); se presenti, riavviare RDAgentBootLoader e RdAgent, verificare la sincronizzazione di DNS e ora, e registrare nuovamente gli host se i token di registrazione sono scaduti.
- Indagare sui ritardi di accesso e sui problemi di collegamento del profilo FSLogix
- Perché: Le operazioni sui profili sono uno dei principali contributori agli accessi lenti.
- Azioni:
- Esaminare i log Microsoft-FSLogix-Apps per accessi negati, violazioni di condivisione o timeout di montaggio; convalidare le ACL della condivisione e NTFS, ed escludere i percorsi VHD(X) dalla scansione antivirus.
- Controllare le metriche di Azure Files Premium e i contatori Perf delle VM per la latenza del disco; aumentare il throughput della condivisione file o migrare i profili su Azure NetApp Files se gli IOPS sono costantemente al di sopra della capacità.
- Identificare i colli di bottiglia delle risorse e la pressione sulla capacità
- Perché: Gli host sovraccarichi causano sia un degrado delle prestazioni sia sintomi di disconnessione in condizioni di contesa.
- Azioni:
- Utilizzare i contatori Perf per rilevare CPU costantemente > 85%, memoria disponibile bassa o latenza del disco elevata; ridurre i limiti di sessione per host o aumentare il numero di host (scale out).
- Abilitare o ottimizzare la scalabilità automatica per aggiungere capacità prima del picco; convalidare il comportamento della modalità di drenaggio (drain mode) per proteggere le sessioni attive durante la riduzione del numero di host (scale-in).
- Implementare avvisi e dashboard proattivi
- Perché: Prevenire le recidive rilevando i segnali di allarme precoci.
- Azioni:
- Creare avvisi per HostRegistration non registrati (not Registered), aumento degli errori di connessione e picchi di errori di FSLogix.
- Costruire una dashboard di capacità che mostri le sessioni attive rispetto al massimo per host e le mappe di calore delle risorse; condividerla con i team operativi e i proprietari del servizio.
Questo approccio combina Azure Service Health per le dipendenze esterne, le impostazioni di diagnostica per la visibilità della piattaforma, AMA+DCR per la telemetria degli host, l’analisi basata su KQL per isolare i domini di errore e la correzione mirata su rete, integrità dell’agent, profili e capacità, garantendo che Adobe Inc. stabilizzi l’esperienza utente e prevenga regressioni future.
← Sicurezza · Tutti i domini · Resilienza →
Esercitati su queste domande → · Pratica cronometrata su ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Supera l'esame →