Google ACE: Fiabilité, sauvegarde et reprise après sinistre — Guide d'étude

Fait partie du Google Associate Cloud Engineer — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Google, ou passez des tests chronométrés sur ExamRoll.io.

Aperçu

La fiabilité, la sauvegarde et la reprise d’activité sur Google Cloud nécessitent une conception intentionnelle qui prend en compte les domaines de défaillance, les mécanismes de protection des données, la gestion du trafic et la préparation opérationnelle. Cette section explique comment structurer les services à travers les zones et les régions, comment protéger et restaurer les données avec état (stateful), et comment valider les objectifs de reprise grâce à des guides opératoires (runbooks) rigoureux et des tests de résilience continus. Elle présente également les compromis des stratégies de reprise d’activité (DR) et la planification de la capacité pour garantir que la plateforme puisse se rétablir en respectant les objectifs de temps de reprise (RTO) et de point de reprise (RPO) définis.

Domaines de défaillance et conception régionale

Exemple :

Protection des données : bases de données, stockage et calcul

Exemple :

undefined

Exemple :

undefined

undefined

Exemple de cycle de vie pour déplacer vers Coldline après 90 jours et supprimer après 365 jours :

undefined

undefined

Résilience du trafic, de la capacité et des dépendances

Opérations de résilience et amélioration continue

Scénario de problème pratique

Brightlane Retail exploite une plateforme de e-commerce dans us-central1 avec une disponibilité stricte et un RPO de quatre heures pour les données de commande. La direction exige de pouvoir survivre à une panne de zone sans interruption de service et à une panne régionale avec un impact minimal pour le client.

Approche :

  1. Implémenter un MIG régional avec autoréparation HTTP et un équilibreur de charge HTTP(S) global

    • Justification : Un MIG régional répartit les instances sur plusieurs zones, et les vérifications de l’état de santé HTTP au niveau de l’application permettent l’autoréparation après trois échecs de vérification de 10 secondes chacun. L’équilibreur de charge global retire automatiquement les VM défaillantes et bascule le trafic vers les zones saines.
    • Commandes : gcloud compute health-checks create http app-hc –check-interval=10s –timeout=5s –unhealthy-threshold=3 –request-path=/healthz gcloud compute instance-groups managed update web-rmig –region=us-central1 –health-check=app-hc –initial-delay=60
  2. Activer la haute disponibilité (HA) de Cloud SQL avec un replica en lecture interrégional et la restauration à un moment précis (PITR)

    • Justification : La haute disponibilité régionale assure la survie aux pannes de zone avec un basculement automatique. Un replica en lecture dans us-east1 fournit une reprise après sinistre régionale avec un RPO non nul mais limité. L’activation de la PITR (journalisation binaire pour MySQL) traite la corruption logique en permettant la restauration à un moment précis.
    • Commandes : gcloud sql instances patch orders-mysql –enable-bin-log –backup-start-time=03:00 gcloud sql instances create orders-replica –master-instance-name=orders-mysql –region=us-east1
  3. Protéger les ressources de type objet avec Cloud Storage en mode bi-régional et des politiques de cycle de vie

    • Justification : Les images de produits et les ressources statiques sont stockées dans un bucket bi-régional pour la résilience régionale. Les transitions de cycle de vie déplacent les artefacts plus anciens vers Coldline pour optimiser les coûts, et la gestion des versions ainsi que les politiques de conservation empêchent la suppression accidentelle des ressources critiques.
    • Étapes : Activer la gestion des versions d’objets (Object Versioning), définir une politique de conservation de 30 jours pour les buckets critiques, et appliquer des règles de cycle de vie pour passer à Coldline après 90 jours et supprimer après un an pour les artefacts de build non critiques.
  4. Planifier des instantanés de disques persistants (PD) et créer des images de machine pour les services avec état

    • Justification : Les instantanés incrémentiels des disques de VM offrent des options de restauration rapides et cohérentes après incident. Les images de machine capturent le démarrage et la configuration pour accélérer la réhydratation des serveurs d’application lors d’un basculement de région. Les planifications d’instantanés garantissent des sauvegardes cohérentes et pilotées par des politiques.
    • Commandes : gcloud compute resource-policies create snapshot-schedule daily-2am –max-retention-days=14 –on-source-disk-delete=apply-retention-policy –start-time=02:00 gcloud compute disks add-resource-policies app-disk-1 –resource-policies=daily-2am gcloud compute machine-images create app-mi-2024-09-01 –source-instance=app-vm-template
  5. Définir le RTO/RPO et codifier les runbooks de reprise après sinistre (DR) et l’IaC

    • Justification : Définir un RTO au niveau du service de 15 minutes pour le web/API et un RPO de quatre heures pour les commandes. Les runbooks spécifient les procédures de basculement du trafic, la promotion du replica en lecture de Cloud SQL, les plans de secours DNS et les étapes de vérification. L’infrastructure en tant que code (Terraform/Deployment Manager) garantit des reconstructions déterministes et réduit les erreurs manuelles.
  6. Provisionner la capacité et les quotas dans la région secondaire

    • Justification : Créer des réservations pour les types de VM critiques, pré-provisionner un backend d’équilibreur de charge en attente, des certificats SSL, de la capacité NAT, et vérifier les quotas pour Compute, SQL, les règles de transfert et KMS dans us-east1. Cela prévient une pénurie de capacité lors du basculement.
  7. Valider la reprise par des exercices de chaos et documenter les améliorations

    • Justification : Des exercices trimestriels de panne de zone valident le comportement du MIG et de l’équilibreur de charge (LB) ; une évacuation régionale semestrielle promeut le replica en lecture dans us-east1, dirige l’équilibreur de charge global vers les backends de us-east1, et mesure le RTO/RPO. Les conclusions orientent les améliorations, telles que la réduction des étapes manuelles ou l’augmentation de la capacité du replica.

En suivant ces étapes, Brightlane Retail atteint une haute disponibilité au niveau de la zone avec une autoréparation automatisée et une posture de reprise après sinistre régionale avec des runbooks définis et testés, garantissant que les données de commande respectent un RPO de quatre heures et que les services applicatifs se rétablissent dans les limites des RTO ciblés.


Sécurité · Tous les domaines · Gestion des coûts

Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Réussissez votre examen →

Parcourir Google →

Related guides

Accès tout-en-un

Un seul abonnement. Chaque examen.

Chaque plan débloque la recherche de réponses illimitée, les tests pratiques, les explications IA et la bibliothèque complète de ressources — en plus de 20 langues.

Mensuel
24.87
Just €0.83/day
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

Meilleur rapport qualité/prix
12 mois
179.87
Just €0.49/daySave 40%
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

✓ Plan gratuit inclus · ✓ Annulez à tout moment · ✓ Tous les plans débloquent le produit complet