Google ACE: Надежность, резервное копирование и аварийное восстановление — Руководство по подготовке

Часть Google Associate Cloud Engineer — Руководство по подготовке. Практикуйтесь с проверенными ответами в центре экзаменов Google, или пройдите тесты на время на ExamRoll.io.

Обзор

Надежность, резервное копирование и аварийное восстановление в Google Cloud требуют продуманного проектирования с учетом доменов отказа, механизмов защиты данных, управления трафиком и эксплуатационной готовности. В этом разделе объясняется, как структурировать сервисы по зонам и регионам, как защищать и восстанавливать данные с отслеживанием состояния (stateful), а также как проверять целевые показатели восстановления с помощью четких инструкций (runbooks) и непрерывного тестирования отказоустойчивости. Также здесь рассматриваются компромиссы различных стратегий аварийного восстановления (DR) и планирование мощностей, чтобы гарантировать восстановление платформы в рамках заданных целевых показателей времени (RTO) и точки восстановления (RPO).

Домены отказа и региональное проектирование

Пример:

Операции по обеспечению отказоустойчивости и непрерывное улучшение

Практический сценарий

Компания Brightlane Retail управляет платформой электронной коммерции в регионе us-central1 со строгими требованиями к доступности и RPO в четыре часа для данных о заказах. Руководство требует обеспечить выживаемость при сбое зоны без простоя и при сбое региона с минимальным влиянием на клиентов.

Подход:

  1. Внедрить региональную MIG с автовосстановлением по HTTP и глобальным HTTP(S) Load Balancer

    • Обоснование: Региональная MIG распределяет инстансы по зонам, а проверки работоспособности на уровне приложения (HTTP) обеспечивают самовосстановление после трех неудачных проверок с интервалом в 10 секунд. Глобальный балансировщик нагрузки автоматически удаляет неработоспособные ВМ и перенаправляет трафик в работоспособные зоны.
    • Команды: gcloud compute health-checks create http app-hc –check-interval=10s –timeout=5s –unhealthy-threshold=3 –request-path=/healthz gcloud compute instance-groups managed update web-rmig –region=us-central1 –health-check=app-hc –initial-delay=60
  2. Включить Cloud SQL HA с межрегиональной репликой чтения и PITR

    • Обоснование: Региональный режим HA обеспечивает выживаемость на уровне зоны с автоматическим переключением. Реплика чтения в us-east1 обеспечивает региональное аварийное восстановление (DR) с ненулевым, но ограниченным RPO. Включение PITR (бинарного журнала для MySQL) решает проблему логического повреждения данных, позволяя восстановиться на определенный момент времени.
    • Команды: gcloud sql instances patch orders-mysql –enable-bin-log –backup-start-time=03:00 gcloud sql instances create orders-replica –master-instance-name=orders-mysql –region=us-east1
  3. Защитить объектные ресурсы с помощью Dual-Region Cloud Storage и политик жизненного цикла

    • Обоснование: Изображения продуктов и статические ресурсы хранятся в бакете dual-region для обеспечения региональной отказоустойчивости. Политики жизненного цикла перемещают старые артефакты в Coldline для оптимизации затрат, а версионирование и политики хранения предотвращают случайное удаление критически важных ресурсов.
    • Шаги: Включить версионирование объектов (Object Versioning), установить 30-дневную политику хранения для критически важных бакетов и применить правила жизненного цикла для перемещения в Coldline через 90 дней и удаления через год для некритичных артефактов сборки.
  4. Настроить расписание для снэпшотов PD и создавать образы машин для stateful-сервисов

    • Обоснование: Инкрементальные снэпшоты дисков ВМ предоставляют быстрые варианты crash-consistent восстановления. Образы машин захватывают загрузочную конфигурацию и настройки для ускорения «разогрева» серверов приложений во время переключения на другой регион. Расписания снэпшотов обеспечивают последовательное резервное копирование на основе политик.
    • Команды: gcloud compute resource-policies create snapshot-schedule daily-2am –max-retention-days=14 –on-source-disk-delete=apply-retention-policy –start-time=02:00 gcloud compute disks add-resource-policies app-disk-1 –resource-policies=daily-2am gcloud compute machine-images create app-mi-2024-09-01 –source-instance=app-vm-template
  5. Определить RTO/RPO и кодифицировать раунбуки для DR и IaC

    • Обоснование: Установить RTO на уровне сервиса в 15 минут для веб/API и RPO в четыре часа для заказов. Раунбуки определяют процедуры переключения трафика, повышение реплики чтения Cloud SQL до основного инстанса, резервные планы для DNS и шаги проверки. Инфраструктура как код (Terraform/Deployment Manager) обеспечивает детерминированные перестроения и снижает количество ручных ошибок.
  6. Выделить мощности и квоты во вторичном регионе

    • Обоснование: Создать резервирования для критически важных типов ВМ, предварительно развернуть резервный бэкенд балансировщика нагрузки, SSL-сертификаты, мощности NAT и проверить квоты для Compute, SQL, правил пересылки и KMS в регионе us-east1. Это предотвращает нехватку мощностей во время переключения.
  7. Проверять восстановление с помощью учений по хаос-инжинирингу и документировать улучшения

    • Обоснование: Ежеквартальные учения по сбою зоны проверяют поведение MIG и LB; полугодовая эвакуация региона включает повышение реплики чтения в us-east1, перенаправление глобального LB на бэкенды в us-east1 и измерение RTO/RPO. Полученные результаты стимулируют улучшения, такие как сокращение ручных шагов или увеличение мощности реплики.

Следуя этим шагам, Brightlane Retail достигает высокой доступности на уровне зоны с автоматическим самовосстановлением и готовности к региональному аварийному восстановлению с определенными, протестированными раунбуками, гарантируя, что данные о заказах соответствуют RPO в четыре часа, а сервисы приложений восстанавливаются в пределах целевых показателей RTO.


Безопасность · Все домены · Управление затратами

Отработать эти вопросы → · Тесты на время на ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Сдайте экзамен →

Просмотреть Google →

Related guides

Все включено

Одна подписка. Каждый экзамен.

Каждый план открывает неограниченный поиск ответов, практические тесты, объяснения AI и полную библиотеку ресурсов — на более чем 20 языках.

Ежемесячно
24.87
Just €0.83/day
Все включено:
  • Неограниченный поиск ответов
  • Неограниченные практические тесты
  • Объяснения на основе AI
  • Полная библиотека ресурсов
  • 20+ языков
  • Еженедельные обновления контента
  • Награды и рефералы
  • Приоритетная поддержка
Начать бесплатную пробную версию

Кредитная карта не требуется*

Лучшая цена
12 месяцев
179.87
Just €0.49/daySave 40%
Все включено:
  • Неограниченный поиск ответов
  • Неограниченные практические тесты
  • Объяснения на основе AI
  • Полная библиотека ресурсов
  • 20+ языков
  • Еженедельные обновления контента
  • Награды и рефералы
  • Приоритетная поддержка
Начать бесплатную пробную версию

Кредитная карта не требуется*

✓ Включен бесплатный план · ✓ Отмена в любое время · ✓ Все планы открывают полный продукт