Microsoft AZ-140: Surveillance, diagnostics et dépannage — Guide d'étude
Fait partie du Microsoft Azure Virtual Desktop Specialty AZ-140 — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Microsoft, ou passez des tests chronométrés sur ExamRoll.io.
Aperçu
La supervision, le diagnostic et le dépannage dans Azure Virtual Desktop (AVD) combinent les journaux de plateforme au niveau des ressources, la télémétrie intra-invité et des analyses pour détecter les problèmes de manière précoce, isoler rapidement les causes profondes et valider l’expérience utilisateur. Une architecture solide utilise Azure Monitor, Log Analytics, l’Azure Monitor Agent, des règles de collecte de données et des workbooks organisés, avec des alertes proactives sur l’état de santé du service et les conditions impactant les utilisateurs. Cette section explique comment concevoir le pipeline de supervision, activer les diagnostics, collecter les données pertinentes depuis les hôtes de session, les analyser avec Kusto Query Language (KQL) et répondre aux problèmes opérationnels les plus courants, y compris la connectivité client, les défaillances de l’agent AVD, les problèmes de profil FSLogix et les goulots d’étranglement des ressources.
Architecture Azure Monitor et Log Analytics pour AVD Insights
Azure Virtual Desktop Insights est une solution basée sur les Azure Monitor Workbooks et Log Analytics qui corrèle les journaux des ressources de la plateforme AVD avec la télémétrie du système d’exploitation invité pour fournir des vues sur l’état de santé, la capacité et l’expérience utilisateur. Son efficacité dépend de deux plans de données :
- Journaux de plateforme/ressources provenant des ressources AVD (pools d’hôtes, espaces de travail, groupes d’applications et le service AVD) via les paramètres de diagnostic.
- Télémétrie invité provenant des hôtes de session via l’Azure Monitor Agent (AMA) et les règles de collecte de données (DCR), incluant les journaux d’événements Windows et les compteurs de performance.
Architecture de l’espace de travail et considérations de conception :
- Espaces de travail centralisés ou par zone d’atterrissage : Un espace de travail unique et régionalement proche simplifie les requêtes, les alertes et la gouvernance. Des parcs très étendus ou des exigences strictes en matière de souveraineté des données peuvent justifier plusieurs espaces de travail. Évitez l’ingestion de données inter-régions non nécessaire en raison de la latence et des coûts.
- Rétention des données et coût : Dimensionnez la rétention en fonction de vos fenêtres d’investigation et de vos besoins réglementaires. La rétention opérationnelle typique est de 30 à 90 jours, avec un archivage vers le stockage pour le long terme. N’activez les journaux de base que si cela est approprié ; les journaux de diagnostic AVD sont mieux utilisés en tant que journaux d’analyse pour la performance des requêtes.
- Multi-locataire/multi-abonnement : Utilisez l’accès centré sur les ressources d’Azure Monitor et Azure RBAC pour accorder des autorisations de requête étendues aux équipes opérationnelles. Diffusez les journaux vers Event Hubs pour le SIEM lorsque nécessaire.
- Visibilité des dépendances : Activez VM insights ou collectez des compteurs de performance pour corréler le CPU, la mémoire, le disque et le réseau avec les données de session et de connexion AVD.
Les workbooks AVD Insights dépendent à la fois des paramètres de diagnostic et de la télémétrie intra-invité ; si l’un des deux est manquant, les visualisations seront incomplètes.
Activation des diagnostics et collecte de la télémétrie
Paramètres de diagnostic sur les ressources AVD
Activez les paramètres de diagnostic pour chacun des types de ressources suivants et envoyez-les à votre espace de travail Log Analytics. Archivez-les optionnellement vers un compte de stockage pour une rétention à long terme et diffusez-les vers Event Hubs pour des analyses externes.
- Pools d’hôtes : Activez des catégories telles que Connection, HostRegistration, Checkpoint, Management, Error et NetworkData. Celles-ci capturent les tentatives de connexion, les changements d’état d’enregistrement de l’agent, les points de contrôle de session et les opérations de gestion.
- Groupes d’applications et espaces de travail : Activez Management et Error pour capturer la publication de flux, les attributions et les changements de configuration.
- Journaux au niveau du service AVD : Lorsque disponibles, activez Error et Management pour obtenir une visibilité sur les opérations de service pertinentes pour votre locataire.
Azure Monitor Agent et DCR sur les hôtes de session
- Choix de l’agent : Utilisez l’Azure Monitor Agent (AMA). L’agent Log Analytics hérité (MMA) est déprécié et doit être supprimé pour éviter la duplication et la confusion.
- Règles de collecte de données (DCR) : Créez des DCR pour collecter :
- Journaux d’événements Windows :
- Microsoft-Windows-RemoteDesktopServices-RdpCoreTS/Operational
- Microsoft-Windows-TerminalServices-LocalSessionManager/Operational
- Microsoft-Windows-TerminalServices-RemoteConnectionManager/Operational
- Microsoft-FSLogix-Apps/Operational et Admin
- Système et Application (pour les événements du système d’exploitation principal, du réseau, de VSS, de SMB, du stockage et du profil)
- Compteurs de performance :
- Processor(_Total)% Processor Time
- System\Processor Queue Length
- Memory\Available MBytes, Memory\Committed Bytes
- LogicalDisk(_Total)\Avg. Disk sec/Read, Avg. Disk sec/Write, Disk Transfers/sec, Free Megabytes
- Network Interface(*)\Bytes Total/sec, Output Queue Length
- Terminal Services\Active Sessions, Inactive Sessions, Total Sessions
- RemoteFX Graphics(*)\Frames Skipped/Second (server, network, client)
- Heartbeat (activé par l’AMA) pour la vitalité de l’hôte.
- Journaux d’événements Windows :
- Portée et gouvernance : Attribuez les DCR aux groupes de ressources des pools d’hôtes ou à des portées de VM dynamiques à l’aide de balises. Évitez les DCR qui se chevauchent et qui collectent les mêmes compteurs ou canaux d’événements pour empêcher la duplication des données et les coûts excessifs.
- VM insights : Activez optionnellement VM insights pour des vues organisées sur la performance et les dépendances ; cela remplit également InsightsMetrics pour une analyse plus riche des tendances de performance.
Analyse opérationnelle et techniques de dépannage
Classeurs et tableaux de bord
- Utilisez les classeurs AVD Insights pour une vue d’ensemble organisée : taux de réussite/échec des connexions, distribution des sessions, état d’enregistrement des hôtes et performances des hôtes de session. Créez des classeurs personnalisés pour les unités commerciales ou les pools d’hôtes avec des indicateurs de performance clés alignés sur les SLA (par exemple, temps de détection de la première défaillance, proxys de durée d’ouverture de session, densité de session).
Requêtes Kusto pour les investigations courantes
- Échecs de connexion par étape et par message :
AzureDiagnostics
| where Category == "Connection"
| extend p = parse_json(Properties)
| summarize Attempts = count(), Failures = countif(tostring(p.Status) != "Success")
by FailureStage = tostring(p.FailureStage),
FailureMessage = tostring(p.FailureMessage)
| order by Failures desc
- Nombre de sessions par hôte et pression sur la capacité :
Perf
| where ObjectName == "Terminal Services" and CounterName in ("Active Sessions","Total Sessions")
| summarize Avg=count(), AvgValue=avg(CounterValue) by bin(TimeGenerated, 5m), Computer, CounterName
- Santé de l’enregistrement de l’agent :
AzureDiagnostics
| where Category == "HostRegistration"
| extend p = parse_json(Properties)
| summarize Latest = arg_max(TimeGenerated, tostring(p.RegistrationState), tostring(p.Details))
by ResourceId
| where Latest_RegistrationState != "Registered"
- Détection d’une utilisation élevée du CPU :
Perf
| where ObjectName == "Processor" and CounterName == "% Processor Time" and InstanceName == "_Total"
| summarize AvgCPU = avg(CounterValue) by Computer, bin(TimeGenerated, 5m)
| where AvgCPU > 85
- Erreurs FSLogix :
Event
| where Source == "Microsoft-FSLogix-Apps"
| project TimeGenerated, Computer, EventID, RenderedDescription
| order by TimeGenerated desc
Diagnostics de connexion et problèmes courants du client
- Étapes à valider :
- Découverte du flux : La récupération de l’espace de travail nécessite un accès à Internet et une authentification Azure AD réussie. L’accès conditionnel ou un décalage horaire peut bloquer l’acquisition du jeton ; vérifiez les stratégies de conformité des appareils et la synchronisation NTP.
- Négociation du broker et de la passerelle : Assurez-vous que le trafic sortant sur le port TCP 443 vers les points de terminaison du service AVD est autorisé par les pare-feu et les proxys. L’inspection SSL peut interrompre les connexions WebSocket ; exemptez les points de terminaison AVD de l’interception.
- Transport RDP : Lorsque RDP Shortpath pour les réseaux publics ou gérés est activé, autorisez le port UDP 3390 comme prévu. S’il est bloqué, les clients se rabattent sur le TCP, ce qui peut dégrader l’expérience utilisateur.
- Symptômes et causes :
- Déconnexions fréquentes ou mauvaise qualité vidéo : UDP bloqué ou perte de paquets élevée ; vérifiez la QoS et la capacité du WAN, priorisez le trafic en temps réel.
- « Aucune ressource disponible » : Échec de l’enregistrement de l’hôte ou capacité épuisée ; confirmez la santé de l’agent et les limites de session.
- Ouvertures de session lentes : Retards dans l’attachement du conteneur de profil, traitement des GPO ou analyse antivirus en temps réel sur les chemins des profils.
Journaux d’événements Windows, composants Remote Desktop et agent AVD
- Services clés : Remote Desktop Services (TermService), Remote Desktop Services Infrastructure Agent (RdAgent) et Remote Desktop Agent Loader (RDAgentBootLoader).
- Journaux de l’agent sur le disque : C:\ProgramData\Microsoft\RDInfra\RDAgent\Logs et C:\ProgramData\Microsoft\RDInfra\RDAgentBootLoader\Logs.
- Canaux d’événements pertinents :
- RdpCoreTS/Operational pour les erreurs de transport et de protocole.
- TerminalServices-LocalSessionManager/Operational pour le cycle de vie de la session.
- TerminalServices-RemoteConnectionManager/Operational pour l’autorisation de connexion et le courtage.
- Dépanner l’enregistrement de l’agent :
- Vérifiez le DNS, la synchronisation de l’heure et le trafic sortant sur le port 443.
- Assurez-vous que l’hôte de session peut résoudre et atteindre les points de terminaison du service AVD.
- Régénérez et appliquez un jeton d’enregistrement valide si l’hôte a été intégré manuellement et que le jeton a expiré.
Journaux FSLogix et dépannage des profils
- Journaux : C:\ProgramData\FSLogix\Logs\Profile*.log et l’Observateur d’événements sous Microsoft-FSLogix-Apps.
- Modes de défaillance courants :
- Accès refusé ou violation de partage sur le VHD(X) : Corrigez les ACL du partage et NTFS ; assurez-vous qu’il n’y a qu’une seule session active par profil utilisateur si le chevauchement multi-session n’est pas autorisé.
- Disque plein ou pics de latence : Surveillez la capacité de stockage et les IOPS. Le stockage Premium ou Azure NetApp Files est souvent requis pour les parcs importants et intensifs en IOPS.
- Cloud Cache : Examinez les CCDLocations et la capacité du lecteur de cache ; l’instabilité du WAN peut augmenter le temps d’ouverture de session.
- Bonnes pratiques :
- Excluez les chemins d’attachement des VHD(X) de l’analyse à l’accès de l’antivirus.
- Utilisez redirections.xml pour conserver les dossiers volumineux et volatiles en dehors du conteneur de profil.
- Validez Kerberos pour l’authentification Azure Files AD DS ; le DNS et les SPN doivent être corrects.
Analyse du CPU, de la mémoire, du disque et du réseau
- CPU : Un % Processor Time élevé avec une file d’attente System\Processor Queue Length soutenue > 2 par vCPU indique une contention du CPU. Augmentez le nombre de vCPU ou réduisez la densité de session.
- Mémoire : Une valeur faible de Memory\Available MBytes et une pagination élevée (Memory\Pages/sec) provoquent des blocages ; ajoutez de la RAM ou réduisez la densité de session. Surveillez la limite de validation (commit limit) et les jeux de travail (working sets) des applications gourmandes.
- Disque : Les seuils de latence sont généralement < 5–10 ms pour les lectures/écritures sur les chemins des profils et temporaires ; surveillez LogicalDisk\Avg. Disk sec/Read et Write. Une inadéquation de la classe de stockage se manifeste par des ouvertures de session longues et des E/S d’application lentes.
- Réseau : Network Interface\Bytes Total/sec et Output Queue Length indiquent une saturation. Des retransmissions TCP élevées et une perte de paquets dégradent la qualité RDP ; confirmez la priorisation QoS pour le trafic AVD.
Tableaux de bord proactifs, alertes et intégrité du service
- Tableaux de bord : Publiez des classeurs affichant la densité de session par hôte par rapport au maximum configuré, le nombre d’états des agents (Inscrit ou Non inscrit), les principaux messages d’échec de connexion et les cartes thermiques de performance.
- Alertes :
- Échecs d’inscription :
AzureDiagnostics
| where Category == "HostRegistration"
| extend p = parse_json(Properties)
| where tostring(p.RegistrationState) != "Registered"
- Pression sur la capacité (seuil d’exemple : sessions actives moyennes à moins de 1 de la limite de l’hôte pendant 10 minutes) :
Perf
| where ObjectName == "Terminal Services" and CounterName == "Active Sessions"
| summarize AvgActive = avg(CounterValue) by Computer, bin(TimeGenerated, 10m)
| join kind=leftouter (
// Replace 20 with your per-host maximum sessions
datatable(Computer:string, MaxSessions:int) [
// Populate from CMDB or tag-driven mapping
]
) on Computer
| where AvgActive >= MaxSessions - 1
- Événements ayant un impact sur l’utilisateur : Déclenchez sur les pics d’échecs de connexion, les erreurs d’attachement FSLogix ou les durées d’ouverture de session lorsqu’elles sont disponibles dans les propriétés de connexion AVD.
- Conflit de ressources : Alertez en cas de CPU > 85 % de manière prolongée, de Mémoire\Mo disponibles < 500 Mo, de disque Avg. sec/Write ou Read > 20 ms.
- Groupes d’actions : Acheminez les alertes vers l’e-mail, Teams, l’ITSM, les runbooks Automation ou les Functions pour la mise à l’échelle automatique ou la remédiation.
- Intégrité du service : Configurez des alertes Azure Service Health pour Azure Virtual Desktop, Storage, Azure Files, Azure NetApp Files et Azure AD pour être informé des pannes ou des maintenances qui pourraient affecter les connexions, les profils ou les sessions avant les utilisateurs.
Scénario de problème pratique
Adobe Inc. signale des déconnexions intermittentes d’Azure Virtual Desktop et des ouvertures de session longues pendant les heures de pointe pour un pool d’hôtes multi-session Windows 11 Entreprise partagé utilisant FSLogix sur Azure Files Premium.
- Vérifier les prérequis de service et de réseau
- Pourquoi : Élimine les causes externes qu’aucune correction sur l’hôte ne peut résoudre.
- Actions :
- Vérifiez Azure Service Health pour les incidents dans la région cible affectant Desktop Virtualization ou Storage.
- Confirmez que les pare-feu des succursales autorisent le trafic sortant sur le port TCP 443 et n’inspectent pas le SSL des points de terminaison AVD ; vérifiez que le port UDP 3390 est autorisé pour améliorer la qualité RDP via Shortpath le cas échéant.
- Valider le pipeline de diagnostics
- Pourquoi : AVD Insights nécessite à la fois les journaux de ressources et la télémétrie intra-invité pour corréler les échecs avec les goulots d’étranglement des ressources.
- Actions :
- Assurez-vous que les paramètres de diagnostic sont activés pour le pool d’hôtes, l’espace de travail et les groupes d’applications avec les catégories Connection, HostRegistration, Checkpoint, Management, Error et NetworkData vers l’espace de travail Log Analytics central.
- Confirmez que l’AMA est installé sur tous les hôtes de session et que la DCR collecte les journaux d’événements et les compteurs de performance liés au RDP.
- Analyser les échecs de connexion et l’état de l’agent
- Pourquoi : Les déconnexions fréquentes sont souvent corrélées à un repli du transport ou à une instabilité de l’inscription de l’agent.
- Actions :
- Exécutez des requêtes de connexion AVD pour identifier les étapes et les messages d’échec ; isolez les erreurs liées au proxy ou au jeton.
- Interrogez HostRegistration pour trouver les hôtes non inscrits (Unregistered) ; si présents, redémarrez RDAgentBootLoader et RdAgent, vérifiez le DNS et la synchronisation de l’heure, et réinscrivez les hôtes si les jetons d’inscription ont expiré.
- Enquêter sur les retards d’ouverture de session et les problèmes d’attachement de profil FSLogix
- Pourquoi : Les opérations de profil sont un contributeur principal aux ouvertures de session longues.
- Actions :
- Examinez les journaux Microsoft-FSLogix-Apps pour les accès refusés, les violations de partage ou les délais d’attente de montage ; validez les ACL de partage et NTFS, et excluez les chemins VHD(X) de l’analyse antivirus.
- Vérifiez les métriques d’Azure Files Premium et les compteurs de performance de la VM pour la latence du disque ; augmentez le débit du partage de fichiers ou migrez les profils vers Azure NetApp Files si les IOPS dépassent constamment la capacité.
- Identifier les goulots d’étranglement des ressources et la pression sur la capacité
- Pourquoi : Les hôtes surchargés provoquent à la fois une dégradation des performances et des symptômes de déconnexion en cas de conflit.
- Actions :
- Utilisez les compteurs de performance pour détecter un CPU > 85 % de manière prolongée, une mémoire disponible faible ou une latence disque élevée ; réduisez les limites de session par hôte ou effectuez un scale-out des hôtes.
- Activez ou ajustez la mise à l’échelle automatique pour ajouter de la capacité avant les pics ; validez le comportement du mode de drainage pour protéger les sessions actives pendant le scale-in.
- Mettre en œuvre des alertes et des tableaux de bord proactifs
- Pourquoi : Prévenir la récurrence en détectant les signaux d’alerte précoces.
- Actions :
- Créez des alertes pour l’état HostRegistration non inscrit (not Registered), l’augmentation des échecs de connexion et les pics d’erreurs FSLogix.
- Construisez un tableau de bord de capacité montrant les sessions actives par rapport au maximum par hôte et des cartes thermiques des ressources ; partagez-le avec les équipes d’exploitation et les propriétaires de service.
Cette approche combine Azure Service Health pour les dépendances externes, les paramètres de diagnostic pour la visibilité de la plateforme, AMA+DCR pour la télémétrie des hôtes, l’analyse basée sur KQL pour isoler les domaines de défaillance, et une remédiation ciblée sur le réseau, l’état de l’agent, les profils et la capacité, garantissant ainsi qu’Adobe Inc. stabilise l’expérience utilisateur et prévient les régressions futures.
← Sécurité · Tous les domaines · Résilience →
Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Réussissez votre examen →