Google ACE: Confiabilidade, Backup e Recuperação de Desastres — Guia de estudos

Faz parte do Google Associate Cloud Engineer — Guia de estudos. Pratique com respostas verificadas no centro de exames da Google, ou faça testes cronometrados no ExamRoll.io.

Visão Geral

Confiabilidade, backup e recuperação de desastres no Google Cloud exigem um projeto intencional que abranja domínios de falha, mecanismos de proteção de dados, gerenciamento de tráfego e prontidão operacional. Esta seção explica como estruturar serviços entre zonas e regiões, como proteger e restaurar dados com estado (stateful) e como validar os objetivos de recuperação com runbooks disciplinados e testes de resiliência contínuos. Ela também descreve os trade-offs da estratégia de DR e o planejamento de capacidade para garantir que a plataforma possa se recuperar dentro dos objetivos definidos de tempo de recuperação (RTO) e ponto de recuperação (RPO).

Domínios de Falha e Projeto Regional

Exemplo:

Proteção de Dados: Bancos de Dados, Armazenamento e Computação

Exemplo:

undefined

Exemplo:

undefined

undefined

Exemplo de ciclo de vida para mover para Coldline após 90 dias e excluir após 365 dias:

undefined

undefined

Resiliência de Tráfego, Capacidade e Dependências

Operações de Resiliência e Melhoria Contínua

Cenário de Problema Prático

A Brightlane Retail opera uma plataforma de e-commerce na região us-central1 com requisitos rígidos de disponibilidade e um RPO de quatro horas para os dados de pedidos. A liderança exige que a plataforma sobreviva a uma interrupção de zona sem tempo de inatividade (downtime) e a uma interrupção regional com impacto mínimo para o cliente.

Abordagem:

  1. Implementar um MIG regional com autohealing por HTTP e um Global HTTP(S) Load Balancer

    • Justificativa: Um MIG regional distribui as instâncias entre zonas, e os health checks HTTP no nível da aplicação permitem a autorrecuperação (self-healing) após três verificações falhas de 10 segundos cada. O balanceador de carga global remove automaticamente as VMs não íntegras e direciona o tráfego por failover para as zonas íntegras.
    • Comandos: gcloud compute health-checks create http app-hc –check-interval=10s –timeout=5s –unhealthy-threshold=3 –request-path=/healthz gcloud compute instance-groups managed update web-rmig –region=us-central1 –health-check=app-hc –initial-delay=60
  2. Habilitar a alta disponibilidade (HA) do Cloud SQL com uma réplica de leitura entre regiões e PITR

    • Justificativa: A alta disponibilidade regional oferece sobrevivência a falhas de zona com failover automático. Uma réplica de leitura (read replica) em us-east1 fornece DR regional com um RPO diferente de zero, mas limitado. Habilitar o PITR (point-in-time recovery, que usa o log binário para o MySQL) resolve a corrupção lógica, permitindo a restauração para um ponto específico no tempo.
    • Comandos: gcloud sql instances patch orders-mysql –enable-bin-log –backup-start-time=03:00 gcloud sql instances create orders-replica –master-instance-name=orders-mysql –region=us-east1
  3. Proteger ativos de objetos com o Cloud Storage Dual-Region e políticas de ciclo de vida

    • Justificativa: Imagens de produtos e ativos estáticos são armazenados em um bucket dual-region para resiliência regional. As transições de ciclo de vida (lifecycle) movem artefatos mais antigos para o Coldline para otimizar custos, e o versionamento somado a políticas de retenção previnem a exclusão acidental de ativos críticos.
    • Etapas: Habilite o Versionamento de Objetos (Object Versioning), defina uma política de retenção de 30 dias para buckets críticos e aplique regras de ciclo de vida para mover para o Coldline após 90 dias e excluir após um ano para artefatos de build não críticos.
  4. Agendar snapshots de Persistent Disk (PD) e criar imagens de máquina para serviços com estado (stateful)

    • Justificativa: Snapshots incrementais dos discos de VM fornecem opções de restauração rápidas e consistentes com o estado no momento da falha (crash-consistent). Imagens de máquina capturam a inicialização e a configuração para acelerar a reidratação dos servidores de aplicação durante um failover de região. Agendamentos de snapshot garantem backups consistentes e orientados por políticas.
    • Comandos: gcloud compute resource-policies create snapshot-schedule daily-2am –max-retention-days=14 –on-source-disk-delete=apply-retention-policy –start-time=02:00 gcloud compute disks add-resource-policies app-disk-1 –resource-policies=daily-2am gcloud compute machine-images create app-mi-2024-09-01 –source-instance=app-vm-template
  5. Definir RTO/RPO e codificar runbooks de DR e IaC (Infrastructure as Code)

    • Justificativa: Defina um RTO no nível de serviço de 15 minutos para web/API e um RPO de quatro horas para pedidos. Os runbooks especificam procedimentos de failover de tráfego, promoção da réplica de leitura do Cloud SQL, contingências de DNS e etapas de verificação. A infraestrutura como código (Terraform/Deployment Manager) garante reconstruções determinísticas e reduz erros manuais.
  6. Provisionar capacidade e cotas na região secundária

    • Justificativa: Crie reservas para tipos de VM críticos, provisione antecipadamente um backend de balanceador de carga em standby, certificados SSL, capacidade de NAT e verifique as cotas para Compute, SQL, regras de encaminhamento e KMS em us-east1. Isso evita a falta de capacidade durante um failover.
  7. Validar a recuperação por meio de simulações de caos (chaos drills) e documentar melhorias

    • Justificativa: Simulações trimestrais de falha de zona validam o comportamento do MIG e do LB; a evacuação regional semestral promove a réplica de leitura em us-east1, aponta o LB global para os backends de us-east1 e mede o RTO/RPO. Os resultados impulsionam melhorias, como a redução de etapas manuais ou o aumento da capacidade da réplica.

Seguindo essas etapas, a Brightlane Retail alcança alta disponibilidade zonal com autorrecuperação automatizada e uma postura de DR regional com runbooks definidos e testados, garantindo que os dados de pedidos atendam a um RPO de quatro horas e que os serviços da aplicação se recuperem dentro dos limites de RTO estabelecidos.


Segurança · Todos os domínios · Gerenciamento de Custos

Pratique estas questões → · Prática cronometrada no ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Passe no seu exame →

Navegar Google →

Related guides

Acesso completo

Uma assinatura. Todos os exames.

Todo plano desbloqueia pesquisa ilimitada de respostas, testes práticos, explicações de AI e a biblioteca completa de recursos — em mais de 20 idiomas.

Mensal
24.87
Just €0.83/day
Tudo incluído:
  • Pesquisa ilimitada de respostas
  • Testes práticos ilimitados
  • Explicações com AI
  • Biblioteca completa de recursos
  • Mais de 20 idiomas
  • Atualizações semanais de conteúdo
  • Recompensas e indicações
  • Suporte prioritário
Iniciar teste grátis

*Não é necessário cartão de crédito

Melhor custo-benefício
12 meses
179.87
Just €0.49/daySave 40%
Tudo incluído:
  • Pesquisa ilimitada de respostas
  • Testes práticos ilimitados
  • Explicações com AI
  • Biblioteca completa de recursos
  • Mais de 20 idiomas
  • Atualizações semanais de conteúdo
  • Recompensas e indicações
  • Suporte prioritário
Iniciar teste grátis

*Não é necessário cartão de crédito

✓ Plano gratuito incluído · ✓ Cancele a qualquer momento · ✓ Todos os planos desbloqueiam o produto completo