Microsoft AZ-801: Аварийное восстановление и непрерывность бизнеса — Руководство по подготовке
Часть Microsoft Windows Server Hybrid Administrator Associate AZ-801 — Руководство по подготовке. Практикуйтесь с проверенными ответами в центре экзаменов Microsoft, или пройдите тесты на время на ExamRoll.io.
Обзор
Проектирование аварийного восстановления (DR) и обеспечения непрерывности бизнеса (BC) начинается с определения двух метрик: целевого времени восстановления (RTO) и целевой точки восстановления (RPO). RTO показывает, как быстро вы должны восстановить сервис; RPO определяет, какой объем потери данных (во времени) является приемлемым. Эти значения определяют выбор технологий, топологию и затраты. Низкий RTO требует оркестрации и автоматизации (планы восстановления Azure Site Recovery, runbooks и предварительно созданные целевые ресурсы). Низкий RPO требует непрерывной репликации (ASR) или синхронной фиксации (SQL Always On), в то время как более высокий RPO может полагаться на периодические резервные копии (Azure Backup, Windows Server Backup). Группы согласованности для нескольких ВМ и согласованные с приложениями снимки сохраняют целостность транзакций между ВМ, когда требуется строгий RPO. Выбор хранилища (Recovery Services vault или Backup vault), разработка политики репликации и планирование резервного копирования — все это делается для достижения этих целей без лишних затрат.
Azure Site Recovery: Hyper-V, VMware, оркестрация и согласованность
Azure Site Recovery (ASR) обеспечивает непрерывную репликацию и оркестрированное аварийное переключение/восстановление для локальных виртуальных машин VMware, Hyper-V и ВМ Azure IaaS.
Защита Hyper-V
- Политика репликации: Определяет порог RPO, срок хранения точек восстановления и частоту создания согласованных с приложениями снимков. Например, установите порог RPO на 15 минут, храните точки восстановления в течение 24–72 часов для отката к определенному моменту времени и создавайте согласованные с приложениями снимки каждые 1–4 часа. Политики контролируют регулирование пропускной способности и сжатие; для связанных ВМ можно включить согласованность нескольких ВМ, чтобы их точки восстановления совпадали.
- Точки восстановления: ASR непрерывно поддерживает согласованные на случай сбоя точки и дополнительные согласованные с приложениями точки, когда заморозка VSS проходит успешно. Срок хранения позволяет выбирать более ранние точки для устранения логического повреждения или последствий атак программ-вымогателей.
- Тестовое аварийное переключение: Неразрушающие учения проверяют runbooks, порядок загрузки и сетевые настройки. Используйте изолированную VNet, предоставьте тестовые входные значения (например, IP-адреса DNS) и убедитесь, что разрешение имен изолировано. Репликация производственной среды продолжается без изменений, а очистка удаляет тестовые артефакты после проверки. Заранее настройте сопоставление сетей и тестовые сопоставления сетевых интерфейсов, чтобы избежать конфликтов IP-адресов.
Защита VMware
- Сервер конфигурации: Локальное устройство, которое регистрируется в хранилище Recovery Services, обнаруживает инвентарь vCenter/ESXi, координирует репликацию и устанавливает агенты Mobility Service. Это плоскость управления для защиты VMware.
- Сервер обработки: Обычно изначально размещается совместно с сервером конфигурации; он выполняет отслеживание изменений, сжатие, шифрование и передачу данных в Azure. Горизонтально масштабируемые серверы обработки добавляются для увеличения пропускной способности и для размещения точки входа трафика рядом с защищаемыми хостами для минимизации задержки.
- Главный целевой сервер: Используется для восстановления из Azure в VMware. Он получает реплицированные изменения во время повторной защиты и предоставляет целевую зону, чтобы вы могли восстановить рабочие нагрузки обратно в vSphere. Рассчитайте размер хранилища под совокупную скорость записи во время восстановления и убедитесь, что пропускная способность сети соответствует пиковым окнам повторной синхронизации.
- Mobility Service: Устанавливается в каждую защищаемую ВМ для захвата изменений на диске. Поддерживайте учетные данные или механизмы принудительной установки в актуальном состоянии и отслеживайте состояние агента в хранилище.
Оркестрация и согласованность
- Планы восстановления: Декларативные runbooks для DR, которые определяют группы, порядок загрузки, шаги ручного утверждения и задачи автоматизации. Используйте runbooks из Azure Automation, чтобы перенастроить NSG, обновить записи DNS, прогреть кэши приложений или выполнить SQL-скрипты. Назначьте логические группы, такие как уровни «Данные», «Приложение» и «Веб», и вставляйте паузы для проверки.
- Runbooks: Автоматизируют задачи, специфичные для окружения, такие как переключение конечных точек диспетчера трафика, масштабирование зависимостей PaaS или отключение локального мониторинга во время аварийного переключения для уменьшения количества ложных оповещений. Параметризуйте их для тестового и производственного аварийного переключения.
- Группы согласованности нескольких ВМ: Включайте для уровней, которые имеют общий порядок записи (например, сервер приложений и модуль записи логов базы данных). Это обеспечивает согласованную во времени точку восстановления для всех ВМ; это решение жертвует пропускной способностью в пользу корректности и должно быть ограничено действительно взаимозависимыми ВМ.
Влияние на RTO/RPO
- Низкий RPO: Предпочтительно использовать ASR с агрессивной репликацией и согласованными с приложениями снимками, серверы обработки, рассчитанные на высокую пропускную способность, и выделенные сети для репликации. Для баз данных рассмотрите возможность использования синхронной фиксации Always On в пределах одного мегаполиса.
- Низкий RTO: Предварительно создайте целевые VNet, подсети и балансировщики нагрузки; используйте планы восстановления с автоматизацией для устранения ручных шагов. Регулярно проводите тестовые аварийные переключения, чтобы определить базовое ожидаемое значение RTO.
Резервное копирование и восстановление: Azure Backup (MARS, MABS/DPM), хранилища и Windows Server Backup
Azure Backup обеспечивает защиту на определённый момент времени для локальных и облачных рабочих нагрузок Azure. Выбирайте правильный тип агента и хранилища в зависимости от рабочей нагрузки и требуемых функций.
Агент MARS (Microsoft Azure Recovery Services agent)
- Политика резервного копирования: Настройте до трех ежедневных резервных копий с детальными параметрами хранения (ежедневно/еженедельно/ежемесячно/ежегодно) в хранилище Recovery Services. Выберите избыточность хранилища (LRS или GRS) и приведите сроки хранения в соответствие с требованиями комплаенса, контролируя при этом рост хранилища. Планируйте операции вне часов пиковой нагрузки на ввод-вывод и при необходимости включайте регулирование сетевого трафика.
- Резервное копирование состояния системы: Поддерживается с MARS для Windows Server для защиты AD, реестра, COM+ и загрузочных файлов. Используйте для восстановления контроллера домена (авторитетного/неавторитетного) или для ремонта ОС без полного резервного копирования на уровне образа.
- Онлайн-восстановление: Восстанавливайте файлы/папки с помощью функций обзора или поиска. Мгновенное восстановление (Instant Restore) монтирует точку восстановления как том для быстрого копирования файлов. Вы можете восстановить данные в исходное или альтернативное расположение и даже на другой сервер, используя учетные данные хранилища на целевом сервере и пройдя аутентификацию в хранилище.
- Управление парольной фразой: Агент MARS использует парольную фразу для шифрования (AES-256), которая хранится у клиента, генерируется и сохраняется локально; у Microsoft ее никогда нет. Потеря парольной фразы делает восстановление невозможным. Храните ее в безопасном, зарезервированном месте (например, как запечатанный секрет Key Vault, защищенный HSM, с доступом через RBAC). Для смены фразы остановите защиту и повторно защитите данные с новой парольной фразой. Включите в хранилище функции обратимого удаления и PIN-кода безопасности для защиты от злонамеренной остановки/удаления.
Azure Backup с MABS/DPM и IaaS
- Резервное копирование для восстановления на «голое железо» (BMR): Используйте Microsoft Azure Backup Server (MABS) или System Center DPM для создания BMR-копий Windows Server. Это позволяет полностью восстанавливать сервер на новом оборудовании или на ВМ путем загрузки в WinRE или с установочного носителя и указания на образ BMR.
- Восстановление в альтернативное расположение: При резервном копировании файлов/данных через MARS/MABS/DPM восстанавливайте их в альтернативное расположение или на другой сервер, чтобы избежать перезаписи исходных данных. При резервном копировании ВМ Azure IaaS (в хранилище Recovery Services) восстанавливайте их как новую ВМ, восстанавливайте диски на существующую ВМ или заменяйте диски. С включенной функцией межрегионального восстановления (Cross-Region Restore) в хранилище вы можете выполнять восстановление в парном регионе в случае региональных сбоев.
- SQL и SAP HANA на виртуальных машинах Azure: Защищайте с помощью расширений, поддерживающих рабочие нагрузки, для создания согласованных с приложениями резервных копий и гранулярного восстановления баз данных. Согласуйте частоту резервного копирования журналов с RPO (например, 15 минут) и сроки хранения с требованиями комплаенса.
Windows Server Backup (WSB)
- Восстановление на «голое железо»: WSB может создавать BMR-копии (системные тома и состояние системы). Храните их на выделенном диске или томе для получения нескольких точек восстановления. При использовании сетевых папок в качестве цели хранится только последняя версия. Для восстановления загрузитесь с носителя Windows в WinRE и выберите «Восстановление образа системы».
- Резервное копирование состояния системы: Обеспечивает быстрое восстановление AD DS, реестра и загрузочных файлов. Полезно для контроллеров домена и серверов конфигурации. Сочетайте с плановым резервным копированием файлов для более широкого охвата.
- Планирование: Используйте оснастку MMC WSB или
undefined
для планирования ежедневных/ежечасных резервных копий. Выбирайте между полным копированием VSS (VSS Full) и копированием VSS (VSS Copy) в зависимости от того, нужно ли усекать журналы приложений. Убедитесь, что окна резервного копирования не совпадают с пиковой нагрузкой на ввод-вывод, и проверяйте целостность каталога (
undefined
).
Типы хранилищ: Recovery Services vault и Backup vault
- Хранилище Служб восстановления (RSV): Традиционное хранилище для резервных копий ВМ Azure, резервных копий агента MARS, MABS/DPM, резервных копий Azure Files, SQL Server на ВМ Azure и SAP HANA на ВМ Azure. Оно также хранит метаданные ASR. Поддерживает такие функции, как обратимое удаление, PIN-код безопасности и межрегиональное восстановление (где применимо).
- Хранилище резервных копий (Backup vault): Модернизированное хранилище для определенных нативных рабочих нагрузок Azure, таких как резервное копирование Azure Disks и Azure Blobs, а также гибких серверов Azure Database for PostgreSQL. Оно использует Azure RBAC для авторизации на уровне управления, поддерживает ключи, управляемые клиентом, параметры неизменяемости и интегрируется с Resource Guard для защиты критически важных операций. Оно не хранит метаданные ASR и на сегодняшний день не заменяет RSV для MARS/MABS/DPM или большинства резервных копий ВМ IaaS.
HA на уровне приложений: SQL Always On и DFS Replication
Некоторые рабочие нагрузки требуют нативной репликации, которая дополняет или заменяет DR на уровне гипервизора в зависимости от RTO/RPO.
Группы доступности Always On (AGs)
- Синхронная и асинхронная фиксация (commit): Синхронная фиксация ожидает, пока вторичная реплика сохранит запись в журнале на диск, прежде чем фиксировать транзакцию на первичной реплике. Это обеспечивает почти нулевую потерю данных (низкий RPO) ценой увеличения задержки и снижения пропускной способности; используется в сетях с низкой задержкой (обычно в пределах города). Асинхронная фиксация не ожидает вторичную реплику, что обеспечивает более высокую производительность в WAN-сетях с потенциальной потерей данных при аварийном переключении (более высокий RPO).
- Условия автоматического аварийного переключения: Для автоматического переключения требуется как минимум две реплики с синхронной фиксацией, у которых включено и синхронизировано автоматическое переключение. Windows Server Failover Clustering отслеживает работоспособность узлов и служб; гибкая политика отработки отказа (flexible failover policy) в SQL Server определяет уровни условий сбоя (от сбоев процессов до серьезных проблем с вводом-выводом). Можно включить обнаружение состояния базы данных, чтобы принудительно запустить переключение, если есть подозрения на сбой основной базы данных. Архитектура с кворумом и свидетелем (witness) предотвращает ситуацию split-brain; убедитесь, что DNS и IP-адреса прослушивателя (listener) готовы на сайте восстановления для быстрого переподключения клиентов.
Репликация DFS (DFSR)
- Группы репликации и подключения: Группа репликации — это набор серверов, реплицирующих одну или несколько реплицируемых папок. Подключения определяют топологию (полносвязная (full mesh), звезда (hub-spoke)), а также расписание и ограничение пропускной способности (bandwidth throttling). Используйте топологию «звезда» для масштабирования и упрощения поиска неисправностей.
- Промежуточная область (staging area): DFSR использует промежуточную область для каждой реплицируемой папки для хранения дельта-файлов для Remote Differential Compression (RDC). Размер промежуточной области должен быть не меньше размера самого большого файла и обычно в 1–2 раза превышать ожидаемый ежедневный объем изменений (daily churn); недостаточный размер приводит к избыточной очистке и повторным попыткам, что негативно сказывается на RPO/RTO.
- Разрешение конфликтов: DFSR — это система с несколькими ведущими узлами (multi-master). При одновременном редактировании DFSR использует векторы версий и временные метки; побеждает последняя запись (last-writer wins), а проигравшая копия перемещается в папку ConflictAndDeleted (размер которой регулируется квотой). Чтобы избежать конфликтов при начальном заполнении (seeding), назначьте основного участника (primary member) только для первоначальной синхронизации. Для сценариев с односторонней репликацией используйте реплицируемые папки только для чтения. Отслеживайте очереди (backlogs) с помощью dfsrdiag и настраивайте расписания для соблюдения RPO.
← Hyper-V · Все домены · Управление удостоверениями и доступом для гибридных сред →
Отработать эти вопросы → · Тесты на время на ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Сдайте экзамен →