Microsoft AZ-140: Monitoramento, Diagnóstico e Solução de Problemas — Guia de estudos
Faz parte do Microsoft Azure Virtual Desktop Specialty AZ-140 — Guia de estudos. Pratique com respostas verificadas no centro de exames da Microsoft, ou faça testes cronometrados no ExamRoll.io.
Visão Geral
O monitoramento, o diagnóstico e a solução de problemas no Azure Virtual Desktop (AVD) combinam logs de plataforma no nível do recurso, telemetria no sistema operacional convidado e análises para detectar problemas precocemente, isolar rapidamente as causas raiz e validar a experiência do usuário. Uma arquitetura sólida utiliza o Azure Monitor, o Log Analytics, o Azure Monitor Agent, regras de coleta de dados e workbooks selecionados, com alertas proativos sobre a integridade do serviço e condições que impactam o usuário. Esta seção explica como projetar o pipeline de monitoramento, habilitar o diagnóstico, coletar os dados corretos dos hosts de sessão, analisá-los com a Kusto Query Language (KQL) e responder aos problemas operacionais mais comuns, incluindo conectividade do cliente, falhas do agente do AVD, problemas de perfil do FSLogix e gargalos de recursos.
Arquitetura do Azure Monitor e Log Analytics para o AVD Insights
O Azure Virtual Desktop Insights é uma solução baseada nos Workbooks do Azure Monitor e no Log Analytics que correlaciona os logs de recursos da plataforma AVD com a telemetria do SO convidado para fornecer visões de integridade, capacidade e experiência do usuário. Sua eficácia depende de dois planos de dados:
- Logs de plataforma/recursos dos recursos do AVD (pools de hosts, workspaces, grupos de aplicativos e o serviço AVD) por meio das configurações de diagnóstico.
- Telemetria do SO convidado dos hosts de sessão por meio do Azure Monitor Agent (AMA) e das Regras de Coleta de Dados (DCRs), incluindo logs de eventos do Windows e contadores de desempenho.
Arquitetura do workspace e considerações de design:
- Workspaces centralizados vs. por landing zone: Um único workspace, regionalmente próximo, simplifica consultas, alertas e governança. Ambientes muito grandes ou requisitos rigorosos de soberania de dados podem justificar múltiplos workspaces. Evite a ingestão de dados entre regiões desnecessariamente devido à latência e ao custo.
- Retenção e custo de dados: Dimensione a retenção de acordo com suas janelas de investigação e necessidades regulatórias. A retenção operacional típica é de 30 a 90 dias, com arquivamento em storage para longo prazo. Habilite logs básicos somente se apropriado; os logs de diagnóstico do AVD são melhores como logs de análise para o desempenho das consultas.
- Multilocatário/múltiplas assinaturas: Use o acesso centrado em recursos do Azure Monitor e o Azure RBAC para conceder permissões de consulta com escopo definido às equipes de operações. Transmita logs para o Event Hubs para integração com SIEM, quando necessário.
- Visibilidade de dependências: Habilite o VM insights ou colete contadores de desempenho para correlacionar CPU, memória, disco e rede com os dados de sessão e conexão do AVD.
Os workbooks do AVD Insights dependem tanto das configurações de diagnóstico quanto da telemetria no SO convidado; se um deles estiver ausente, as visualizações ficarão incompletas.
Habilitando o Diagnóstico e Coletando Telemetria
Configurações de diagnóstico nos recursos do AVD
Habilite as configurações de diagnóstico para cada um dos seguintes tipos de recurso e envie-as para o seu workspace do Log Analytics. Opcionalmente, arquive em uma conta de armazenamento para retenção de longo prazo e transmita para o Event Hubs para análises externas.
- Pools de hosts: Habilite categorias como Connection, HostRegistration, Checkpoint, Management, Error e NetworkData. Elas capturam tentativas de conexão, alterações de estado de registro do agente, checkpoints de sessão e operações de gerenciamento.
- Grupos de aplicativos e workspaces: Habilite Management e Error para capturar a publicação de feeds, atribuições e alterações de configuração.
- Logs no nível de serviço do AVD: Onde disponível, habilite Error e Management para obter visibilidade sobre as operações de serviço relevantes para o seu tenant.
Azure Monitor Agent e DCRs nos hosts de sessão
- Escolha do agente: Use o Azure Monitor Agent (AMA). O agente legado do Log Analytics (MMA) está obsoleto e deve ser removido para evitar duplicação e confusão.
- Regras de Coleta de Dados (DCRs): Crie DCRs para coletar:
- Logs de eventos do Windows:
- Microsoft-Windows-RemoteDesktopServices-RdpCoreTS/Operational
- Microsoft-Windows-TerminalServices-LocalSessionManager/Operational
- Microsoft-Windows-TerminalServices-RemoteConnectionManager/Operational
- Microsoft-FSLogix-Apps/Operational e Admin
- System e Application (para eventos do SO principal, rede, VSS, SMB, armazenamento e perfil)
- Contadores de desempenho:
- Processor(_Total)% Processor Time
- System\Processor Queue Length
- Memory\Available MBytes, Memory\Committed Bytes
- LogicalDisk(_Total)\Avg. Disk sec/Read, Avg. Disk sec/Write, Disk Transfers/sec, Free Megabytes
- Network Interface(*)\Bytes Total/sec, Output Queue Length
- Terminal Services\Active Sessions, Inactive Sessions, Total Sessions
- RemoteFX Graphics(*)\Frames Skipped/Second (server, network, client)
- Heartbeat (habilitado pelo AMA) para verificação de atividade do host.
- Logs de eventos do Windows:
- Escopo e governança: Atribua DCRs aos grupos de recursos dos pools de hosts ou a escopos dinâmicos de VMs usando tags. Evite DCRs sobrepostas que coletam os mesmos contadores ou canais de eventos para prevenir dados duplicados e custos excessivos.
- VM insights: Opcionalmente, habilite o VM insights para obter visões selecionadas de desempenho e dependência; ele também preenche a tabela InsightsMetrics para uma análise de tendências de desempenho mais rica.
Análise Operacional e Técnicas de Solução de Problemas
Workbooks e dashboards
- Use os workbooks do AVD Insights para uma visão geral selecionada: taxas de sucesso/falha de conexão, distribuição de sessões, status de registro do host e desempenho do host de sessão. Crie workbooks personalizados para unidades de negócios ou pools de hosts com indicadores-chave de desempenho (KPIs) alinhados aos SLAs (por exemplo, tempo para detectar a primeira falha, proxies de duração de logon, densidade de sessão).
Consultas Kusto para investigações comuns
- Falhas de conexão por estágio e mensagem:
AzureDiagnostics
| where Category == "Connection"
| extend p = parse_json(Properties)
| summarize Attempts = count(), Failures = countif(tostring(p.Status) != "Success")
by FailureStage = tostring(p.FailureStage),
FailureMessage = tostring(p.FailureMessage)
| order by Failures desc
- Contagem de sessões por host e pressão de capacidade:
Perf
| where ObjectName == "Terminal Services" and CounterName in ("Active Sessions","Total Sessions")
| summarize Avg=count(), AvgValue=avg(CounterValue) by bin(TimeGenerated, 5m), Computer, CounterName
- Saúde do registro do agente:
AzureDiagnostics
| where Category == "HostRegistration"
| extend p = parse_json(Properties)
| summarize Latest = arg_max(TimeGenerated, tostring(p.RegistrationState), tostring(p.Details))
by ResourceId
| where Latest_RegistrationState != "Registered"
- Detecção de alta utilização de CPU:
Perf
| where ObjectName == "Processor" and CounterName == "% Processor Time" and InstanceName == "_Total"
| summarize AvgCPU = avg(CounterValue) by Computer, bin(TimeGenerated, 5m)
| where AvgCPU > 85
- Erros do FSLogix:
Event
| where Source == "Microsoft-FSLogix-Apps"
| project TimeGenerated, Computer, EventID, RenderedDescription
| order by TimeGenerated desc
Diagnóstico de conexão e problemas comuns do cliente
- Estágios a serem validados:
- Descoberta do feed: a recuperação do Workspace requer acesso à internet e autenticação bem-sucedida no Azure AD. O Acesso Condicional (Conditional Access) ou a distorção de tempo (time skew) podem bloquear a aquisição do token; verifique as políticas de conformidade do dispositivo e a sincronização NTP.
- Negociação de broker e gateway: garanta que o tráfego de saída na porta TCP 443 para os endpoints de serviço do AVD seja permitido em firewalls e proxies. A inspeção SSL (SSL inspection) pode interromper as conexões WebSocket; isente os endpoints do AVD da interceptação.
- Transporte RDP: quando o RDP Shortpath para redes públicas ou gerenciadas estiver habilitado, permita o tráfego na porta UDP 3390 conforme projetado. Se bloqueado, os clientes retornam ao TCP (fallback), o que pode degradar a experiência do usuário.
- Sintomas e causas:
- Desconexões frequentes ou vídeo de baixa qualidade: UDP bloqueado ou alta perda de pacotes; verifique o QoS e a capacidade da WAN, priorize o tráfego em tempo real.
- “Nenhum recurso disponível” (“No available resources”): falha no registro do host ou capacidade esgotada; confirme a saúde do agente e os limites de sessão.
- Logons lentos: atrasos na anexação do contêiner de perfil, processamento de GPO ou varredura em tempo real do antivírus nos caminhos do perfil.
Logs de eventos do Windows, componentes do Remote Desktop e agente do AVD
- Serviços principais: Remote Desktop Services (TermService), Remote Desktop Services Infrastructure Agent (RdAgent) e Remote Desktop Agent Loader (RDAgentBootLoader).
- Logs do agente em disco: C:\ProgramData\Microsoft\RDInfra\RDAgent\Logs e C:\ProgramData\Microsoft\RDInfra\RDAgentBootLoader\Logs.
- Canais de eventos relevantes:
- RdpCoreTS/Operational para erros de transporte e protocolo.
- TerminalServices-LocalSessionManager/Operational para o ciclo de vida da sessão.
- TerminalServices-RemoteConnectionManager/Operational para autorização e intermediação (brokering) da conexão.
- Solução de problemas de registro do agente:
- Verifique o DNS, a sincronização de tempo e o tráfego de saída na porta 443.
- Garanta que o host de sessão consiga resolver e alcançar os endpoints de serviço do AVD.
- Regere e aplique um token de registro atual se o host foi integrado manualmente e o token expirou.
Logs do FSLogix e solução de problemas de perfil
- Logs: C:\ProgramData\FSLogix\Logs\Profile*.log e no Visualizador de Eventos (Event Viewer) em Microsoft-FSLogix-Apps.
- Modos de falha comuns:
- Acesso negado ou violação de compartilhamento (sharing violation) no VHD(X): corrija as ACLs de compartilhamento e NTFS; garanta apenas uma sessão ativa por perfil de usuário se a sobreposição de várias sessões não for permitida.
- Disco cheio ou picos de latência: monitore a capacidade de armazenamento e o IOPS. Armazenamento Premium ou Azure NetApp Files são frequentemente necessários para ambientes grandes e intensivos em IOPS.
- Cloud Cache: revise os CCDLocations e a capacidade da unidade de cache; a instabilidade da WAN pode aumentar o tempo de logon.
- Melhores práticas:
- Exclua os caminhos de anexação do VHD(X) da varredura em tempo real (on-access scanning) do antivírus.
- Use o redirections.xml para manter pastas grandes e voláteis fora do contêiner de perfil.
- Valide o Kerberos para autenticação do Azure Files no AD DS; o DNS e os SPNs devem estar corretos.
Análise de CPU, memória, disco e rede
- CPU: um valor alto de % Processor Time com um System\Processor Queue Length sustentado > 2 por vCPU indica contenção de CPU. Aumente o número de vCPUs ou reduza a densidade de sessões.
- Memória: um valor baixo de Memory\Available MBytes e paginação alta (Memory\Pages/sec) causam travamentos; adicione RAM ou reduza a densidade de sessões. Observe o limite de alocação (commit limit) e os conjuntos de trabalho (working sets) de aplicativos pesados.
- Disco: os limites de latência são normalmente < 5–10 ms para leituras/escritas nos caminhos de perfil e temporários; monitore LogicalDisk\Avg. Disk sec/Read e Write. A incompatibilidade da classe de armazenamento se manifesta como logons demorados e E/S de aplicativos lenta.
- Rede: Network Interface\Bytes Total/sec e Output Queue Length mostram saturação. Altas retransmissões de TCP e perda de pacotes degradam a qualidade do RDP; confirme a priorização de QoS para o tráfego do AVD.
Dashboards Proativos, Alertas e Integridade do Serviço
- Dashboards: Publique workbooks que mostrem a densidade de sessões por host vs. o máximo configurado, contagens de estado do agente (Registered vs. Unregistered), principais mensagens de falha de conexão e mapas de calor de desempenho.
- Alertas:
- Falhas de registro:
AzureDiagnostics
| where Category == "HostRegistration"
| extend p = parse_json(Properties)
| where tostring(p.RegistrationState) != "Registered"
- Pressão de capacidade (exemplo de limiar: média de sessões ativas a 1 do limite do host por 10 minutos):
Perf
| where ObjectName == "Terminal Services" and CounterName == "Active Sessions"
| summarize AvgActive = avg(CounterValue) by Computer, bin(TimeGenerated, 10m)
| join kind=leftouter (
// Replace 20 with your per-host maximum sessions
datatable(Computer:string, MaxSessions:int) [
// Populate from CMDB or tag-driven mapping
]
) on Computer
| where AvgActive >= MaxSessions - 1
- Eventos de impacto ao usuário: Acione em picos de falhas de conexão, erros de anexação do FSLogix ou durações de logon, quando disponíveis nas propriedades de conexão do AVD.
- Contenção de recursos: Alerte sobre CPU sustentada > 85%, Memory\Available MBytes < 500 MB, Disk Avg. sec/Write ou Read > 20 ms.
- Grupos de ação: Encaminhe alertas para e-mail, Teams, ITSM, runbooks de Automação ou Functions para autoescalonamento ou remediação.
- Integridade do serviço: Configure alertas do Azure Service Health para Azure Virtual Desktop, Storage, Azure Files, Azure NetApp Files e Azure AD para saber sobre interrupções ou manutenções que possam afetar logins, perfis ou sessões antes dos usuários.
Cenário de Problema Prático
A Adobe Inc. relata desconexões intermitentes do Azure Virtual Desktop e longos tempos de logon durante o horário de pico para um host pool compartilhado (pooled) do Windows 11 Enterprise multi-session usando FSLogix no Azure Files Premium.
- Verificar pré-requisitos de serviço e rede
- Por quê: Descarta causas externas que nenhuma correção no host pode resolver.
- Ações:
- Verifique o Azure Service Health em busca de incidentes na região de destino que afetem Desktop Virtualization ou Storage.
- Confirme se os firewalls da filial permitem tráfego de saída na porta TCP 443 e não fazem inspeção SSL nos endpoints do AVD; verifique se a porta UDP 3390 é permitida para melhorar a qualidade do RDP via Shortpath, quando aplicável.
- Validar o pipeline de diagnóstico
- Por quê: O AVD Insights requer tanto logs de recursos quanto telemetria no sistema operacional convidado (in-guest) para correlacionar falhas com gargalos de recursos.
- Ações:
- Garanta que as configurações de diagnóstico estejam habilitadas para o host pool, workspace e grupos de aplicativos com as categorias Connection, HostRegistration, Checkpoint, Management, Error e NetworkData enviando para o workspace central do Log Analytics.
- Confirme se o AMA está instalado em todos os hosts de sessão e se o DCR está coletando logs de eventos e contadores de desempenho relacionados ao RDP.
- Analisar falhas de conexão e a saúde do agente
- Por quê: Desconexões frequentes muitas vezes se correlacionam com fallback de transporte ou instabilidade no registro do agente.
- Ações:
- Execute consultas de Conexão do AVD para identificar estágios e mensagens de falha; isole erros relacionados a proxy ou token.
- Consulte HostRegistration para encontrar hosts como Unregistered; se houver, reinicie o RDAgentBootLoader e o RdAgent, verifique o DNS e a sincronização de tempo, e registre novamente os hosts se os tokens de registro expiraram.
- Investigar atrasos de logon e problemas de anexação de perfil do FSLogix
- Por quê: Operações de perfil são um dos principais contribuintes para longos tempos de logon.
- Ações:
- Revise os logs do Microsoft-FSLogix-Apps em busca de acesso negado, violações de compartilhamento ou timeouts de montagem; valide as ACLs de compartilhamento e NTFS, e exclua os caminhos VHD(X) da varredura do antivírus.
- Verifique as métricas do Azure Files Premium e os contadores de desempenho da VM para latência de disco; aumente a taxa de transferência (throughput) do compartilhamento de arquivos ou migre os perfis para o Azure NetApp Files se o IOPS estiver consistentemente acima da capacidade.
- Identificar gargalos de recursos e pressão de capacidade
- Por quê: Hosts sobrecarregados causam tanto degradação de desempenho quanto sintomas de desconexão sob contenção.
- Ações:
- Use contadores de desempenho (Perf counters) para detectar CPU sustentada > 85%, baixa memória disponível ou alta latência de disco; reduza os limites de sessão por host ou adicione mais hosts (scale out).
- Habilite ou ajuste o autoescalonamento para adicionar capacidade antes do pico; valide o comportamento do modo de drenagem (drain mode) para proteger as sessões ativas durante o scale-in.
- Implementar alertas e dashboards proativos
- Por quê: Evite a recorrência detectando sinais de alerta precoce.
- Ações:
- Crie alertas para HostRegistration com status diferente de Registered, aumento de falhas de Conexão e picos de erros do FSLogix.
- Construa um dashboard de capacidade mostrando sessões ativas vs. máximo por host e mapas de calor de recursos; compartilhe com as equipes de operações e os donos do serviço.
Esta abordagem combina o Azure Service Health para dependências externas, configurações de diagnóstico para visibilidade da plataforma, AMA+DCR para telemetria do host, análise orientada por KQL para isolar domínios de falha e remediação direcionada em rede, saúde do agente, perfis e capacidade — garantindo que a Adobe Inc. estabilize a experiência do usuário e previna regressões futuras.
← Segurança · Todos os domínios · Resiliência →
Pratique estas questões → · Prática cronometrada no ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Passe no seu exame →