Google ACE: Fiabilidad, copias de seguridad y recuperación ante desastres — Guía de estudio

Forma parte de la Google Associate Cloud Engineer — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Google, o realiza tests cronometrados en ExamRoll.io.

Descripción general

La fiabilidad, las copias de seguridad y la recuperación ante desastres en Google Cloud requieren un diseño intencionado que abarque los dominios de fallo, los mecanismos de protección de datos, la gestión del tráfico y la preparación operativa. Esta sección explica cómo estructurar los servicios entre zonas y regiones, cómo proteger y restaurar datos con estado, y cómo validar los objetivos de recuperación con runbooks disciplinados y pruebas de resiliencia continuas. También describe las contrapartidas de la estrategia de DR y la planificación de capacidad para garantizar que la plataforma pueda recuperarse dentro de los objetivos definidos de tiempo de recuperación (RTO) y punto de recuperación (RPO).

Dominios de fallo y diseño regional

Ejemplo:

Protección de datos: bases de datos, almacenamiento y computación

Ejemplo:

Ejemplo:

Ejemplo de ciclo de vida para mover a Coldline después de 90 días y eliminar después de 365 días:

Resiliencia de tráfico, capacidad y dependencias

Operaciones de resiliencia y mejora continua

Escenario de problema práctico

Brightlane Retail opera una plataforma de comercio electrónico en us-central1 con una disponibilidad estricta y un RPO de cuatro horas para los datos de pedidos. La dirección exige sobrevivir a una interrupción zonal sin tiempo de inactividad y a una interrupción regional con un impacto mínimo para el cliente.

Enfoque:

  1. Implementar un MIG regional con autorreparación HTTP y un HTTP(S) Load Balancer global

    • Justificación: Un MIG regional distribuye las instancias entre zonas, y las comprobaciones de estado HTTP a nivel de aplicación permiten la autorreparación tras tres comprobaciones fallidas de 10 segundos cada una. El balanceador de carga global elimina automáticamente las VM en mal estado y conmuta el tráfico a las zonas sanas.
    • Comandos: gcloud compute health-checks create http app-hc –check-interval=10s –timeout=5s –unhealthy-threshold=3 –request-path=/healthz gcloud compute instance-groups managed update web-rmig –region=us-central1 –health-check=app-hc –initial-delay=60
  2. Habilitar la alta disponibilidad (HA) de Cloud SQL con una réplica de lectura entre regiones y PITR

    • Justificación: La HA regional proporciona supervivencia zonal con conmutación por error automática. Una réplica de lectura en us-east1 proporciona DR regional con un RPO no nulo pero acotado. Habilitar PITR (registro binario para MySQL) soluciona la corrupción lógica al permitir la restauración a un punto en el tiempo.
    • Comandos: gcloud sql instances patch orders-mysql –enable-bin-log –backup-start-time=03:00 gcloud sql instances create orders-replica –master-instance-name=orders-mysql –region=us-east1
  3. Proteger los activos de objetos con Cloud Storage de doble región y políticas de ciclo de vida

    • Justificación: Las imágenes de productos y los activos estáticos se almacenan en un bucket de doble región para la resiliencia regional. Las transiciones del ciclo de vida mueven los artefactos más antiguos a Coldline para optimizar costes, y el control de versiones junto con las políticas de retención evitan la eliminación accidental de activos críticos.
    • Pasos: Habilitar el control de versiones de objetos (Object Versioning), establecer una política de retención de 30 días para los buckets críticos y aplicar reglas de ciclo de vida para la transición a Coldline después de 90 días y la eliminación después de un año para los artefactos de compilación no críticos.
  4. Programar instantáneas de PD y crear imágenes de máquina para servicios con estado (stateful)

    • Justificación: Las instantáneas incrementales de los discos de VM proporcionan opciones de restauración rápidas y consistentes ante caídas. Las imágenes de máquina capturan el arranque y la configuración para acelerar la rehidratación de los servidores de aplicaciones durante una conmutación por error regional. La programación de instantáneas garantiza copias de seguridad consistentes y basadas en políticas.
    • Comandos: gcloud compute resource-policies create snapshot-schedule daily-2am –max-retention-days=14 –on-source-disk-delete=apply-retention-policy –start-time=02:00 gcloud compute disks add-resource-policies app-disk-1 –resource-policies=daily-2am gcloud compute machine-images create app-mi-2024-09-01 –source-instance=app-vm-template
  5. Definir RTO/RPO y codificar los runbooks de DR y la IaC

    • Justificación: Establecer un RTO a nivel de servicio de 15 minutos para la web/API y un RPO de cuatro horas para los pedidos. Los runbooks especifican los procedimientos de conmutación por error del tráfico, la promoción de la réplica de lectura de Cloud SQL, las contingencias de DNS y los pasos de verificación. La infraestructura como código (Terraform/Deployment Manager) garantiza reconstrucciones deterministas y reduce el error manual.
  6. Aprovisionar capacidad y cuotas en la región secundaria

    • Justificación: Crear reservas para las formas de VM críticas, preaprovisionar un backend de balanceador de carga en espera, certificados SSL, capacidad de NAT y verificar las cuotas para Compute, SQL, reglas de reenvío y KMS en us-east1. Esto evita la falta de capacidad durante una conmutación por error.
  7. Validar la recuperación mediante simulacros de caos y documentar las mejoras

    • Justificación: Los simulacros trimestrales de fallos zonales validan el comportamiento del MIG y del LB; la evacuación regional semestral promueve la réplica de lectura en us-east1, apunta el LB global a los backends de us-east1 y mide el RTO/RPO. Los hallazgos impulsan mejoras como la reducción de pasos manuales o el aumento de la capacidad de la réplica.

Siguiendo estos pasos, Brightlane Retail logra una alta disponibilidad zonal con autorreparación automatizada y una postura de DR regional con runbooks definidos y probados, asegurando que los datos de los pedidos cumplan con un RPO de cuatro horas y que los servicios de la aplicación se recuperen dentro de los límites de RTO establecidos.


Seguridad · Todos los dominios · Gestión de costos

Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Aprueba tu examen →

Explorar Google →

Related guides

Acceso todo en uno

Una suscripción. Todos los exámenes.

Cada plan desbloquea la búsqueda ilimitada de respuestas, pruebas de práctica, explicaciones de AI y la biblioteca completa de recursos, en más de 20 idiomas.

Mensual
24.87
Just €0.83/day
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

Mejor valor
12 meses
179.87
Just €0.49/daySave 40%
Todo incluido:
  • Búsqueda ilimitada de respuestas
  • Pruebas de práctica ilimitadas
  • Explicaciones con tecnología AI
  • Biblioteca completa de recursos
  • Más de 20 idiomas
  • Actualizaciones semanales de contenido
  • Recompensas y referencias
  • Soporte prioritario
Iniciar prueba gratuita

No se requiere tarjeta de crédito*

✓ Plan gratuito incluido · ✓ Cancela en cualquier momento · ✓ Todos los planes desbloquean el producto completo