Microsoft AZ-140: Мониторинг, диагностика и устранение неполадок — Руководство по подготовке
Часть Microsoft Azure Virtual Desktop Specialty AZ-140 — Руководство по подготовке. Практикуйтесь с проверенными ответами в центре экзаменов Microsoft, или пройдите тесты на время на ExamRoll.io.
Обзор
Мониторинг, диагностика и устранение неполадок в Azure Virtual Desktop (AVD) объединяют журналы платформы на уровне ресурсов, телеметрию гостевых систем и аналитику для раннего обнаружения проблем, быстрого выявления первопричин и оценки пользовательского опыта. Надежная архитектура использует Azure Monitor, Log Analytics, Azure Monitor Agent, правила сбора данных и специализированные книги (workbooks), а также проактивные оповещения о работоспособности службы и условиях, влияющих на пользователей. В этом разделе объясняется, как спроектировать конвейер мониторинга, включить диагностику, собирать необходимые данные с узлов сеансов, анализировать их с помощью Kusto Query Language (KQL) и реагировать на наиболее распространенные операционные проблемы, включая проблемы с подключением клиентов, сбои агента AVD, проблемы с профилями FSLogix и нехватку ресурсов.
Архитектура Azure Monitor и Log Analytics для AVD Insights
Azure Virtual Desktop Insights — это решение, построенное на базе Azure Monitor Workbooks и Log Analytics, которое сопоставляет журналы ресурсов платформы AVD с телеметрией гостевой ОС для предоставления представлений о работоспособности, емкости и пользовательском опыте. Его эффективность зависит от двух плоскостей данных:
- Журналы платформы/ресурсов от ресурсов AVD (пулы узлов, рабочие области, группы приложений и служба AVD) через параметры диагностики.
- Телеметрия гостевых систем с узлов сеансов через Azure Monitor Agent (AMA) и правила сбора данных (DCR), включая журналы событий Windows и счетчики производительности.
Архитектура рабочей области и аспекты проектирования:
- Централизованные рабочие области или по одной на целевую зону: единая, расположенная в близком регионе рабочая область упрощает запросы, оповещения и управление. Очень крупные инфраструктуры или строгие требования к суверенитету данных могут оправдать использование нескольких рабочих областей. Избегайте ненужного приема данных между регионами из-за задержек и затрат.
- Хранение данных и затраты: определяйте срок хранения в соответствии с вашими окнами расследования и нормативными требованиями. Типичный срок оперативного хранения составляет 30–90 дней, с архивацией в хранилище для долгосрочного хранения. Включайте базовые журналы (basic logs) только в подходящих случаях; диагностические журналы AVD лучше всего использовать как аналитические журналы (analytics logs) для повышения производительности запросов.
- Мультитенантность/несколько подписок: используйте ориентированный на ресурсы доступ Azure Monitor и Azure RBAC для предоставления командам эксплуатации ограниченных разрешений на выполнение запросов. При необходимости передавайте журналы в Event Hubs для SIEM.
- Видимость зависимостей: включите VM insights или собирайте счетчики производительности, чтобы сопоставлять данные о ЦП, памяти, диске и сети с данными о сеансах и подключениях AVD.
Книги AVD Insights зависят как от параметров диагностики, так и от телеметрии гостевых систем; если что-либо из этого отсутствует, визуализации будут неполными.
Включение диагностики и сбор телеметрии
Параметры диагностики для ресурсов AVD
Включите параметры диагностики для каждого из следующих типов ресурсов и отправляйте данные в вашу рабочую область Log Analytics. При необходимости архивируйте в хранилище для долгосрочного хранения и передавайте в Event Hubs для внешней аналитики.
- Пулы узлов: включите такие категории, как Connection, HostRegistration, Checkpoint, Management, Error и NetworkData. Они фиксируют попытки подключения, изменения состояния регистрации агента, контрольные точки сеансов и операции управления.
- Группы приложений и рабочие области: включите Management и Error для фиксации публикаций каналов, назначений и изменений конфигурации.
- Журналы на уровне службы AVD: там, где это доступно, включите Error и Management, чтобы получить представление об операциях службы, относящихся к вашему тенанту.
Azure Monitor Agent и DCR на узлах сеансов
- Выбор агента: используйте Azure Monitor Agent (AMA). Устаревший агент Log Analytics (MMA) не рекомендуется к использованию и должен быть удален, чтобы избежать дублирования и путаницы.
- Правила сбора данных (DCR): создайте DCR для сбора:
- Журналы событий Windows:
- Microsoft-Windows-RemoteDesktopServices-RdpCoreTS/Operational
- Microsoft-Windows-TerminalServices-LocalSessionManager/Operational
- Microsoft-Windows-TerminalServices-RemoteConnectionManager/Operational
- Microsoft-FSLogix-Apps/Operational и Admin
- System и Application (для событий ядра ОС, сети, VSS, SMB, хранилища и профилей)
- Счетчики производительности:
- Processor(_Total)% Processor Time
- System\Processor Queue Length
- Memory\Available MBytes, Memory\Committed Bytes
- LogicalDisk(_Total)\Avg. Disk sec/Read, Avg. Disk sec/Write, Disk Transfers/sec, Free Megabytes
- Network Interface(*)\Bytes Total/sec, Output Queue Length
- Terminal Services\Active Sessions, Inactive Sessions, Total Sessions
- RemoteFX Graphics(*)\Frames Skipped/Second (server, network, client)
- Heartbeat (включается агентом AMA) для проверки работоспособности узла.
- Журналы событий Windows:
- Область применения и управление: назначайте DCR группам ресурсов пулов узлов или динамическим областям ВМ с помощью тегов. Избегайте пересекающихся DCR, которые собирают одни и те же счетчики или каналы событий, чтобы предотвратить дублирование данных и лишние затраты.
- VM insights: при необходимости включите VM insights для получения специализированных представлений о производительности и зависимостях; это также заполняет таблицу InsightsMetrics для более глубокого анализа тенденций производительности.
Операционный анализ и методы устранения неполадок
Книги и панели мониторинга
- Используйте книги AVD Insights для получения обобщенной информации: процент успешных/неуспешных подключений, распределение сеансов, статус регистрации узлов и производительность узлов сеансов. Создавайте пользовательские книги для бизнес-подразделений или пулов узлов с ключевыми показателями производительности (KPI), соответствующими соглашениям об уровне обслуживания (SLA) (например, время до обнаружения первого сбоя, косвенные показатели длительности входа, плотность сеансов).
Kusto-запросы для стандартных расследований
- Сбои подключения по этапам и сообщениям:
AzureDiagnostics
| where Category == "Connection"
| extend p = parse_json(Properties)
| summarize Attempts = count(), Failures = countif(tostring(p.Status) != "Success")
by FailureStage = tostring(p.FailureStage),
FailureMessage = tostring(p.FailureMessage)
| order by Failures desc
- Количество сеансов на узел и нагрузка на ресурсы:
Perf
| where ObjectName == "Terminal Services" and CounterName in ("Active Sessions","Total Sessions")
| summarize Avg=count(), AvgValue=avg(CounterValue) by bin(TimeGenerated, 5m), Computer, CounterName
- Состояние регистрации агента:
AzureDiagnostics
| where Category == "HostRegistration"
| extend p = parse_json(Properties)
| summarize Latest = arg_max(TimeGenerated, tostring(p.RegistrationState), tostring(p.Details))
by ResourceId
| where Latest_RegistrationState != "Registered"
- Обнаружение высокой загрузки ЦП:
Perf
| where ObjectName == "Processor" and CounterName == "% Processor Time" and InstanceName == "_Total"
| summarize AvgCPU = avg(CounterValue) by Computer, bin(TimeGenerated, 5m)
| where AvgCPU > 85
- Ошибки FSLogix:
Event
| where Source == "Microsoft-FSLogix-Apps"
| project TimeGenerated, Computer, EventID, RenderedDescription
| order by TimeGenerated desc
Диагностика подключений и распространенные проблемы клиентов
- Этапы для проверки:
- Обнаружение веб-канала (Feed discovery): Для получения рабочей области требуется доступ в Интернет и успешная аутентификация в Azure AD. Условный доступ (Conditional Access) или рассинхронизация времени могут блокировать получение токена; проверьте политики соответствия устройств и синхронизацию NTP.
- Взаимодействие с брокером и шлюзом: Убедитесь, что исходящий трафик по TCP 443 к конечным точкам службы AVD разрешен в брандмауэрах и прокси-серверах. Проверка SSL (SSL inspection) может нарушить WebSocket-соединения; исключите конечные точки AVD из перехвата трафика.
- Транспорт RDP: Если включен RDP Shortpath для публичных или управляемых сетей, разрешите трафик по UDP 3390, как это предусмотрено. Если он заблокирован, клиенты переключаются на TCP, что может ухудшить взаимодействие с пользователем.
- Симптомы и причины:
- Частые отключения или плохое качество видео: UDP заблокирован или высокий уровень потери пакетов; проверьте QoS и пропускную способность WAN, приоритизируйте трафик реального времени.
- «Нет доступных ресурсов» (“No available resources”): Сбой регистрации узла или исчерпание ресурсов; проверьте состояние агента и лимиты сеансов.
- Медленный вход в систему: Задержки при подключении контейнера профиля, обработка GPO или сканирование путей к профилям антивирусом в реальном времени.
Журналы событий Windows, компоненты удаленного рабочего стола и агент AVD
- Ключевые службы: Remote Desktop Services (TermService), Remote Desktop Services Infrastructure Agent (RdAgent) и Remote Desktop Agent Loader (RDAgentBootLoader).
- Логи агента на диске: C:\ProgramData\Microsoft\RDInfra\RDAgent\Logs и C:\ProgramData\Microsoft\RDInfra\RDAgentBootLoader\Logs.
- Соответствующие каналы событий:
- RdpCoreTS/Operational для ошибок транспорта и протокола.
- TerminalServices-LocalSessionManager/Operational для жизненного цикла сеанса.
- TerminalServices-RemoteConnectionManager/Operational для авторизации подключения и брокеринга.
- Устранение неполадок с регистрацией агента:
- Проверьте DNS, синхронизацию времени и исходящий трафик по порту 443.
- Убедитесь, что узел сеансов может разрешать имена и имеет доступ к конечным точкам службы AVD.
- Пересоздайте и примените актуальный токен регистрации, если узел был добавлен вручную и срок действия токена истек.
Логи FSLogix и устранение неполадок с профилями
- Логи: C:\ProgramData\FSLogix\Logs\Profile*.log и в Просмотре событий (Event Viewer) в разделе Microsoft-FSLogix-Apps.
- Распространенные типы сбоев:
- Отказано в доступе или нарушение совместного доступа к VHD(X): Исправьте разрешения на общем ресурсе (share) и NTFS ACL; убедитесь, что на один профиль пользователя приходится только один активный сеанс, если пересечение нескольких сеансов не разрешено.
- Диск переполнен или скачки задержки: Отслеживайте емкость хранилища и IOPS. Для крупных сред с высокой интенсивностью операций ввода-вывода часто требуются хранилища класса Premium или Azure NetApp Files.
- Cloud Cache: Проверьте параметр CCDLocations и емкость диска для кэша; нестабильность WAN может увеличить время входа в систему.
- Рекомендации:
- Исключите пути подключения VHD(X) из сканирования антивирусом при доступе.
- Используйте redirections.xml, чтобы исключить большие изменяемые папки из контейнера профиля.
- Проверьте Kerberos для аутентификации Azure Files через AD DS; DNS и SPN должны быть настроены правильно.
Анализ ЦП, памяти, диска и сети
- ЦП: Высокое значение % Processor Time при стабильной длине очереди процессора (System\Processor Queue Length) > 2 на vCPU указывает на нехватку ресурсов ЦП. Увеличьте количество vCPU или уменьшите плотность сеансов.
- Память: Низкое значение доступной памяти (Memory\Available MBytes) и высокая активность файла подкачки (Memory\Pages/sec) вызывают зависания; добавьте RAM или уменьшите плотность сеансов. Следите за пределом выделенной памяти (commit limit) и рабочими наборами (working sets) ресурсоемких приложений.
- Диск: Пороговые значения задержки обычно < 5–10 мс для операций чтения/записи на путях к профилям и временным файлам; отслеживайте LogicalDisk\Avg. Disk sec/Read и Write. Несоответствие класса хранилища проявляется в виде длительного входа в систему и медленного ввода-вывода приложений.
- Сеть: Network Interface\Bytes Total/sec и Output Queue Length показывают насыщение канала. Большое количество повторных передач TCP и потеря пакетов ухудшают качество RDP; подтвердите приоритизацию трафика AVD с помощью QoS.
Проактивные панели мониторинга, оповещения и работоспособность служб
- Панели мониторинга: Публикуйте книги с отображением плотности сеансов на каждом узле в сравнении с настроенным максимумом, количества агентов по состояниям (Registered и Unregistered), основных сообщений о сбоях подключений и тепловых карт производительности.
- Оповещения:
- Сбои регистрации:
AzureDiagnostics
| where Category == "HostRegistration"
| extend p = parse_json(Properties)
| where tostring(p.RegistrationState) != "Registered"
- Нагрузка на ресурсы (пример порогового значения: среднее количество активных сеансов в пределах 1 от лимита узла в течение 10 минут):
Perf
| where ObjectName == "Terminal Services" and CounterName == "Active Sessions"
| summarize AvgActive = avg(CounterValue) by Computer, bin(TimeGenerated, 10m)
| join kind=leftouter (
// Replace 20 with your per-host maximum sessions
datatable(Computer:string, MaxSessions:int) [
// Populate from CMDB or tag-driven mapping
]
) on Computer
| where AvgActive >= MaxSessions - 1
- События, влияющие на пользователей: Активация при всплесках сбоев подключений, ошибках подключения FSLogix или увеличении длительности входа в систему, когда эти данные доступны в свойствах подключения AVD.
- Конкуренция за ресурсы: Оповещение при устойчивом превышении CPU > 85%, Memory\Available MBytes < 500 МБ, Disk Avg. sec/Write или Read > 20 мс.
- Группы действий: Направляйте оповещения на электронную почту, в Teams, ITSM, модули runbook службы Automation или в Functions для автомасштабирования или исправления.
- Работоспособность служб: Настройте оповещения Azure Service Health для Azure Virtual Desktop, Storage, Azure Files, Azure NetApp Files и Azure AD, чтобы узнавать о сбоях или плановом обслуживании, которые могут повлиять на входы в систему, профили или сеансы, раньше пользователей.
Практический сценарий проблемы
Компания Adobe Inc. сообщает о периодических отключениях в Azure Virtual Desktop и длительных входах в систему в часы пик для пула узлов с Windows 11 Enterprise (многосеансовая) с использованием FSLogix на Azure Files Premium.
- Проверка предварительных требований к службам и сети
- Зачем: Исключает внешние причины, которые невозможно устранить на уровне узла.
- Действия:
- Проверьте Azure Service Health на наличие инцидентов в целевом регионе, влияющих на Desktop Virtualization или Storage.
- Убедитесь, что брандмауэры филиалов разрешают исходящие подключения по TCP 443 и не выполняют SSL-инспекцию конечных точек AVD; проверьте, что UDP 3390 разрешен для улучшения качества RDP через Shortpath, где это применимо.
- Проверка конвейера диагностики
- Зачем: Для AVD Insights требуются как журналы ресурсов, так и телеметрия с гостевых ОС для сопоставления сбоев с узкими местами в ресурсах.
- Действия:
- Убедитесь, что параметры диагностики включены для пула узлов, рабочей области и групп приложений, и что категории Connection, HostRegistration, Checkpoint, Management, Error и NetworkData отправляются в центральную рабочую область Log Analytics.
- Убедитесь, что AMA установлен на всех узлах сеансов и что DCR собирает соответствующие журналы событий RDP и счетчики производительности.
- Анализ сбоев подключений и работоспособности агента
- Зачем: Частые отключения часто коррелируют с переключением на резервный транспорт или нестабильностью регистрации агента.
- Действия:
- Выполните запросы к AVD Connection для определения этапов сбоя и сообщений об ошибках; выявите ошибки, связанные с прокси или токенами.
- Выполните запрос к HostRegistration, чтобы найти узлы в состоянии Unregistered; если они есть, перезапустите RDAgentBootLoader и RdAgent, проверьте DNS и синхронизацию времени и повторно зарегистрируйте узлы, если срок действия токенов регистрации истек.
- Расследование задержек входа в систему и проблем с подключением профилей FSLogix
- Зачем: Операции с профилями — основной фактор, влияющий на длительность входа в систему.
- Действия:
- Просмотрите журналы Microsoft-FSLogix-Apps на предмет ошибок отказа в доступе, нарушений совместного доступа или тайм-аутов подключения; проверьте списки ACL для общей папки и NTFS и исключите пути к VHD(X) из антивирусного сканирования.
- Проверьте метрики Azure Files Premium и счетчики производительности ВМ на предмет задержек диска; увеличьте пропускную способность файлового ресурса или перенесите профили на Azure NetApp Files, если IOPS постоянно превышает емкость.
- Выявление узких мест в ресурсах и нагрузки на емкость
- Зачем: Перегруженные узлы вызывают как снижение производительности, так и симптомы отключения при конкуренции за ресурсы.
- Действия:
- Используйте счетчики производительности для обнаружения устойчивого превышения CPU > 85%, нехватки доступной памяти или высокой задержки диска; уменьшите лимиты сеансов на узел или выполните горизонтальное масштабирование узлов.
- Включите или настройте автомасштабирование для добавления ресурсов перед пиковой нагрузкой; проверьте поведение режима
drain modeдля защиты активных сеансов во время обратного масштабирования.
- Внедрение проактивных оповещений и панелей мониторинга
- Зачем: Предотвращение повторения проблемы путем обнаружения ранних предупреждающих сигналов.
- Действия:
- Создайте оповещения для состояния HostRegistration, отличного от Registered, роста числа сбоев Connection и всплесков ошибок FSLogix.
- Создайте панель мониторинга емкости, показывающую количество активных сеансов в сравнении с максимальным на каждом узле, и тепловые карты ресурсов; предоставьте доступ операционным командам и владельцам сервиса.
Этот подход сочетает использование Azure Service Health для отслеживания внешних зависимостей, параметров диагностики для видимости платформы, AMA+DCR для телеметрии узлов, анализа на основе KQL для изоляции доменов сбоя и целенаправленного исправления проблем в сети, работоспособности агента, профилях и емкости, обеспечивая стабилизацию пользовательского опыта для Adobe Inc. и предотвращение будущих регрессий.
← Безопасность · Все домены · Отказоустойчивость →
Отработать эти вопросы → · Тесты на время на ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Сдайте экзамен →