Microsoft AZ-140: Supervisión, diagnóstico y solución de problemas — Guía de estudio
Forma parte de la Microsoft Azure Virtual Desktop Specialty AZ-140 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Microsoft, o realiza tests cronometrados en ExamRoll.io.
Información general
La supervisión, el diagnóstico y la solución de problemas en Azure Virtual Desktop (AVD) combinan registros de plataforma a nivel de recurso, telemetría en el invitado y análisis para detectar problemas de forma temprana, aislar las causas raíz rápidamente y validar la experiencia del usuario. Una arquitectura sólida utiliza Azure Monitor, Log Analytics, Azure Monitor Agent, reglas de recopilación de datos y libros de trabajo seleccionados, con alertas proactivas sobre el estado del servicio y condiciones que afectan al usuario. Esta sección explica cómo diseñar la canalización de supervisión, habilitar el diagnóstico, recopilar los datos correctos de los hosts de sesión, analizarlos con Kusto Query Language (KQL) y responder a los problemas operativos más comunes, incluida la conectividad del cliente, los fallos del agente de AVD, los problemas de perfil de FSLogix y los cuellos de botella de recursos.
Arquitectura de Azure Monitor y Log Analytics para AVD Insights
Azure Virtual Desktop Insights es una solución basada en Azure Monitor Workbooks y Log Analytics que correlaciona los registros de recursos de la plataforma AVD con la telemetría del SO invitado para proporcionar vistas de estado, capacidad y experiencia del usuario. Su eficacia depende de dos planos de datos:
- Registros de plataforma/recurso de los recursos de AVD (grupos de hosts, áreas de trabajo, grupos de aplicaciones y el servicio AVD) a través de la configuración de diagnóstico.
- Telemetría de invitado desde los hosts de sesión a través del Agente de Azure Monitor (AMA) y las Reglas de recopilación de datos (DCR), incluidos los registros de eventos de Windows y los contadores de rendimiento.
Arquitectura del área de trabajo y consideraciones de diseño:
- Áreas de trabajo centralizadas frente a por zona de aterrizaje: Un área de trabajo única y regionalmente cercana simplifica las consultas, las alertas y la gobernanza. Entornos muy grandes o requisitos estrictos de soberanía de datos pueden justificar múltiples áreas de trabajo. Evite la ingesta de datos entre regiones innecesariamente debido a la latencia y el coste.
- Retención de datos y coste: Dimensione la retención según sus ventanas de investigación y necesidades normativas. La retención operativa típica es de 30 a 90 días, con archivado en almacenamiento a largo plazo. Habilite los registros básicos solo si es apropiado; los registros de diagnóstico de AVD funcionan mejor como registros de análisis para el rendimiento de las consultas.
- Multitenant/multisuscripción: Utilice el acceso centrado en recursos de Azure Monitor y Azure RBAC para otorgar permisos de consulta con ámbito a los equipos de operaciones. Transmita los registros a Event Hubs para SIEM cuando sea necesario.
- Visibilidad de dependencias: Habilite VM insights o recopile contadores de rendimiento para correlacionar la CPU, la memoria, el disco y la red con los datos de sesión y conexión de AVD.
Los libros de trabajo de AVD Insights dependen tanto de la configuración de diagnóstico como de la telemetría en el invitado; si falta alguno de los dos, las visualizaciones estarán incompletas.
Habilitación del diagnóstico y recopilación de telemetría
Configuración de diagnóstico en los recursos de AVD
Habilite la configuración de diagnóstico para cada uno de los siguientes tipos de recursos y envíelos a su área de trabajo de Log Analytics. Opcionalmente, archívelos en almacenamiento para retención a largo plazo y transmítalos a Event Hubs para análisis externos.
- Grupos de hosts: Habilite categorías como Connection, HostRegistration, Checkpoint, Management, Error y NetworkData. Estas capturan intentos de conexión, cambios de estado en el registro del agente, puntos de control de sesión y operaciones de gestión.
- Grupos de aplicaciones y áreas de trabajo: Habilite Management y Error para capturar la publicación de fuentes, las asignaciones y los cambios de configuración.
- Registros a nivel de servicio de AVD: Donde esté disponible, habilite Error y Management para obtener visibilidad de las operaciones de servicio relevantes para su tenant.
Agente de Azure Monitor y DCR en los hosts de sesión
- Elección del agente: Utilice el Agente de Azure Monitor (AMA). El agente heredado de Log Analytics (MMA) está obsoleto y debe eliminarse para evitar duplicaciones y confusiones.
- Reglas de recopilación de datos (DCR): Cree DCR para recopilar:
- Registros de eventos de Windows:
- Microsoft-Windows-RemoteDesktopServices-RdpCoreTS/Operational
- Microsoft-Windows-TerminalServices-LocalSessionManager/Operational
- Microsoft-Windows-TerminalServices-RemoteConnectionManager/Operational
- Microsoft-FSLogix-Apps/Operational y Admin
- System y Application (para eventos del SO principal, redes, VSS, SMB, almacenamiento y perfiles)
- Contadores de rendimiento:
- Processor(_Total)% Processor Time
- System\Processor Queue Length
- Memory\Available MBytes, Memory\Committed Bytes
- LogicalDisk(_Total)\Avg. Disk sec/Read, Avg. Disk sec/Write, Disk Transfers/sec, Free Megabytes
- Network Interface(*)\Bytes Total/sec, Output Queue Length
- Terminal Services\Active Sessions, Inactive Sessions, Total Sessions
- RemoteFX Graphics(*)\Frames Skipped/Second (server, network, client)
- Heartbeat (habilitado por AMA) para la actividad del host.
- Registros de eventos de Windows:
- Ámbito y gobernanza: Asigne las DCR a los grupos de recursos de los grupos de hosts o a ámbitos de VM dinámicos mediante etiquetas. Evite la superposición de DCR que recopilen los mismos contadores o canales de eventos para evitar datos duplicados y costes excesivos.
- VM insights: Opcionalmente, habilite VM insights para obtener vistas seleccionadas de rendimiento y dependencias; también rellena InsightsMetrics para un análisis más rico de las tendencias de rendimiento.
Análisis operativo y técnicas de solución de problemas
Libros y paneles de control
- Utilice los libros de AVD Insights para obtener una visión general seleccionada: tasas de éxito/fallo de conexión, distribución de sesiones, estado de registro del host y rendimiento del host de sesión. Cree libros personalizados para unidades de negocio o grupos de hosts con indicadores clave de rendimiento (KPI) alineados con los SLA (por ejemplo, tiempo de detección del primer fallo, proxies de duración de inicio de sesión, densidad de sesiones).
Consultas Kusto para investigaciones comunes
- Fallos de conexión por etapa y mensaje:
AzureDiagnostics
| where Category == "Connection"
| extend p = parse_json(Properties)
| summarize Attempts = count(), Failures = countif(tostring(p.Status) != "Success")
by FailureStage = tostring(p.FailureStage),
FailureMessage = tostring(p.FailureMessage)
| order by Failures desc
- Recuento de sesiones por host y presión de capacidad:
Perf
| where ObjectName == "Terminal Services" and CounterName in ("Active Sessions","Total Sessions")
| summarize Avg=count(), AvgValue=avg(CounterValue) by bin(TimeGenerated, 5m), Computer, CounterName
- Estado del registro del agente:
AzureDiagnostics
| where Category == "HostRegistration"
| extend p = parse_json(Properties)
| summarize Latest = arg_max(TimeGenerated, tostring(p.RegistrationState), tostring(p.Details))
by ResourceId
| where Latest_RegistrationState != "Registered"
- Detección de CPU alta:
Perf
| where ObjectName == "Processor" and CounterName == "% Processor Time" and InstanceName == "_Total"
| summarize AvgCPU = avg(CounterValue) by Computer, bin(TimeGenerated, 5m)
| where AvgCPU > 85
- Errores de FSLogix:
Event
| where Source == "Microsoft-FSLogix-Apps"
| project TimeGenerated, Computer, EventID, RenderedDescription
| order by TimeGenerated desc
Diagnóstico de conexión y problemas comunes del cliente
- Etapas a validar:
- Detección de fuentes (feed): La recuperación del espacio de trabajo requiere acceso a internet y una autenticación exitosa en Azure AD. El Acceso Condicional o un desfase horario pueden bloquear la adquisición de tokens; verifique las políticas de cumplimiento de dispositivos y la sincronización NTP.
- Negociación de bróker y puerta de enlace: Asegúrese de que el tráfico saliente por TCP 443 hacia los puntos de conexión del servicio AVD esté permitido a través de firewalls y proxies. La inspección SSL puede romper las conexiones WebSocket; exima los puntos de conexión de AVD de la interceptación.
- Transporte RDP: Cuando RDP Shortpath para redes públicas o administradas está habilitado, permita el tráfico por UDP 3390 según el diseño. Si se bloquea, los clientes recurren a TCP, lo que puede degradar la experiencia del usuario.
- Síntomas y causas:
- Desconexiones frecuentes o video de mala calidad: UDP bloqueado o alta pérdida de paquetes; verifique la QoS y la capacidad de la WAN, priorice el tráfico en tiempo real.
- “No hay recursos disponibles”: Fallo en el registro del host o capacidad agotada; confirme el estado del agente y los límites de sesión.
- Inicios de sesión lentos: Retrasos al adjuntar el contenedor de perfil, procesamiento de GPO o escaneo en tiempo real del antivirus en las rutas de los perfiles.
Registros de eventos de Windows, componentes de Remote Desktop y agente de AVD
- Servicios clave: Remote Desktop Services (TermService), Remote Desktop Services Infrastructure Agent (RdAgent) y Remote Desktop Agent Loader (RDAgentBootLoader).
- Registros del agente en disco: C:\ProgramData\Microsoft\RDInfra\RDAgent\Logs y C:\ProgramData\Microsoft\RDInfra\RDAgentBootLoader\Logs.
- Canales de eventos relevantes:
- RdpCoreTS/Operational para errores de transporte y protocolo.
- TerminalServices-LocalSessionManager/Operational para el ciclo de vida de la sesión.
- TerminalServices-RemoteConnectionManager/Operational para la autorización y el corretaje de conexiones.
- Solucionar problemas de registro del agente:
- Verifique el DNS, la sincronización horaria y el puerto 443 saliente.
- Asegúrese de que el host de sesión pueda resolver y alcanzar los puntos de conexión del servicio AVD.
- Regenere y aplique un token de registro actual si el host se incorporó manualmente y el token ha expirado.
Registros de FSLogix y solución de problemas de perfiles
- Registros: C:\ProgramData\FSLogix\Logs\Profile*.log y Visor de eventos en Microsoft-FSLogix-Apps.
- Modos de fallo comunes:
- Acceso denegado o infracción de uso compartido en el VHD(X): Corrija los permisos del recurso compartido y las ACL de NTFS; asegúrese de que solo haya una sesión activa por perfil de usuario si no se permite la superposición de varias sesiones.
- Disco lleno o picos de latencia: Supervise la capacidad de almacenamiento y los IOPS. A menudo se requiere almacenamiento Premium o Azure NetApp Files para entornos grandes e intensivos en IOPS.
- Cloud Cache: Revise las CCDLocations y la capacidad de la unidad de caché; la inestabilidad de la WAN puede aumentar el tiempo de inicio de sesión.
- Mejores prácticas:
- Excluya las rutas de montaje de VHD(X) del escaneo de acceso del antivirus.
- Use redirections.xml para mantener las carpetas volátiles grandes fuera del contenedor del perfil.
- Valide Kerberos para la autenticación de Azure Files con AD DS; el DNS y los SPN deben ser correctos.
Análisis de CPU, memoria, disco y red
- CPU: Un % Processor Time alto con un System\Processor Queue Length sostenido > 2 por vCPU indica contención de CPU. Aumente las vCPU o reduzca la densidad de sesiones.
- Memoria: Un valor bajo de Memory\Available MBytes y una paginación alta (Memory\Pages/sec) causan bloqueos; agregue RAM o reduzca la densidad de sesiones. Vigile el límite de confirmación (commit limit) y los conjuntos de trabajo (working sets) de las aplicaciones pesadas.
- Disco: Los umbrales de latencia suelen ser < 5–10 ms para lecturas/escrituras en las rutas de perfil y temporales; supervise LogicalDisk\Avg. Disk sec/Read y Write. Un desajuste en la clase de almacenamiento se manifiesta como inicios de sesión largos y E/S de aplicaciones lenta.
- Red: Network Interface\Bytes Total/sec y Output Queue Length muestran saturación. Las retransmisiones TCP altas y la pérdida de paquetes degradan la calidad de RDP; confirme la priorización de QoS para el tráfico de AVD.
Paneles, alertas y estado del servicio proactivos
- Paneles: Publicar libros de trabajo que muestren la densidad de sesiones por host frente al máximo configurado, recuentos del estado del agente (Registrado frente a No registrado), los principales mensajes de error de conexión y mapas de calor de rendimiento.
- Alertas:
- Fallos de registro:
AzureDiagnostics
| where Category == "HostRegistration"
| extend p = parse_json(Properties)
| where tostring(p.RegistrationState) != "Registered"
- Presión de capacidad (umbral de ejemplo: promedio de sesiones activas a 1 del límite del host durante 10 minutos):
Perf
| where ObjectName == "Terminal Services" and CounterName == "Active Sessions"
| summarize AvgActive = avg(CounterValue) by Computer, bin(TimeGenerated, 10m)
| join kind=leftouter (
// Replace 20 with your per-host maximum sessions
datatable(Computer:string, MaxSessions:int) [
// Populate from CMDB or tag-driven mapping
]
) on Computer
| where AvgActive >= MaxSessions - 1
- Eventos de impacto para el usuario: Activar ante picos en fallos de conexión, errores de adjuntar de FSLogix o duraciones de inicio de sesión cuando estén disponibles en las propiedades de conexión de AVD.
- Contención de recursos: Alertar sobre CPU sostenida > 85 %, Memory\Available MBytes < 500 MB, Disk Avg. sec/Write o Read > 20 ms.
- Grupos de acciones: Dirigir las alertas a correo electrónico, Teams, ITSM, runbooks de Automation o Functions para autoescalado o remediación.
- Estado del servicio: Configurar alertas de Azure Service Health para Azure Virtual Desktop, Storage, Azure Files, Azure NetApp Files y Azure AD para informarse sobre interrupciones o mantenimientos que podrían afectar los inicios de sesión, perfiles o sesiones antes que los usuarios.
Escenario de problema práctico
Adobe Inc. reporta desconexiones intermitentes de Azure Virtual Desktop e inicios de sesión prolongados durante las horas pico para un grupo de hosts de sesión múltiple agrupado (pooled) de Windows 11 Enterprise que utiliza FSLogix en Azure Files Premium.
- Verificar los prerrequisitos de servicio y de red
- Por qué: Descarta causas externas que ninguna solución en el host puede abordar.
- Acciones:
- Revisar Azure Service Health en busca de incidentes en la región de destino que afecten a Desktop Virtualization o Storage.
- Confirmar que los firewalls de las sucursales permiten el tráfico saliente por TCP 443 y no realizan inspección SSL de los puntos de conexión de AVD; verificar que se permite UDP 3390 para mejorar la calidad de RDP a través de Shortpath cuando sea aplicable.
- Validar la canalización de diagnósticos
- Por qué: AVD Insights requiere tanto los registros de recursos como la telemetría interna del invitado (in-guest) para correlacionar los fallos con los cuellos de botella de recursos.
- Acciones:
- Asegurarse de que la configuración de diagnóstico esté habilitada para el grupo de hosts, el área de trabajo y los grupos de aplicaciones con las categorías Connection, HostRegistration, Checkpoint, Management, Error y NetworkData hacia el área de trabajo central de Log Analytics.
- Confirmar que AMA está instalado en todos los hosts de sesión y que la DCR está recopilando los registros de eventos y los contadores de rendimiento relacionados con RDP.
- Analizar los fallos de conexión y el estado del agente
- Por qué: Las desconexiones frecuentes a menudo se correlacionan con el repliegue (fallback) del transporte o la inestabilidad del registro del agente.
- Acciones:
- Ejecutar consultas de conexión de AVD para identificar las etapas y los mensajes de fallo; aislar los errores relacionados con el proxy o los tokens.
- Consultar HostRegistration para encontrar hosts no registrados (Unregistered); si los hay, reiniciar RDAgentBootLoader y RdAgent, verificar el DNS y la sincronización de la hora, y volver a registrar los hosts si los tokens de registro han expirado.
- Investigar los retrasos en el inicio de sesión y los problemas al adjuntar perfiles de FSLogix
- Por qué: Las operaciones de perfil son un contribuyente principal a los inicios de sesión prolongados.
- Acciones:
- Revisar los registros de Microsoft-FSLogix-Apps en busca de acceso denegado, infracciones de uso compartido o tiempos de espera de montaje; validar los ACL del recurso compartido y de NTFS, y excluir las rutas de los VHD(X) del escaneo antivirus.
- Revisar las métricas de Azure Files Premium y los contadores de rendimiento de la VM para detectar latencia de disco; aumentar el rendimiento (throughput) del recurso de archivos compartido o migrar los perfiles a Azure NetApp Files si los IOPS superan constantemente la capacidad.
- Identificar cuellos de botella de recursos y presión de capacidad
- Por qué: Los hosts sobrecargados causan tanto degradación del rendimiento como síntomas de desconexión bajo contención.
- Acciones:
- Usar los contadores de rendimiento (Perf counters) para detectar CPU sostenida > 85 %, poca memoria disponible o alta latencia de disco; reducir los límites de sesión por host o escalar horizontalmente los hosts (scale out).
- Habilitar o ajustar el autoescalado para añadir capacidad antes del pico; validar el comportamiento del modo de drenaje (drain mode) para proteger las sesiones activas durante el escalado horizontal hacia adentro (scale-in).
- Implementar alertas y paneles proactivos
- Por qué: Prevenir la recurrencia detectando señales de advertencia tempranas.
- Acciones:
- Crear alertas para HostRegistration no Registrado, aumento de fallos de conexión y picos de errores de FSLogix.
- Construir un panel de capacidad que muestre las sesiones activas frente al máximo por host y mapas de calor de recursos; compartirlo con los propietarios de operaciones y del servicio.
Este enfoque combina Azure Service Health para las dependencias externas, la configuración de diagnóstico para la visibilidad de la plataforma, AMA+DCR para la telemetría del host, el análisis impulsado por KQL para aislar los dominios de fallo y la remediación dirigida a través de la red, el estado del agente, los perfiles y la capacidad, asegurando que Adobe Inc. estabilice la experiencia del usuario y prevenga regresiones futuras.
← Seguridad · Todos los dominios · Resiliencia →
Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Aprueba tu examen →