Microsoft AZ-305: Alta Disponibilidad, Recuperación ante Desastres y Continuidad del Negocio — Guía de estudio
Forma parte de la Microsoft Azure Solutions Architect Expert AZ-305 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Microsoft, o realiza tests cronometrados en ExamRoll.io.
Información general
La alta disponibilidad (HA), la recuperación ante desastres (DR) y la continuidad del negocio (BC) en Azure requieren un diseño deliberado que abarca las capas de computación, datos y redes. La resiliencia comienza con objetivos claros de tiempo de recuperación (RTO) y de punto de recuperación (RPO), y luego compone las capacidades de la plataforma —Availability Zones, enrutamiento global, replicación de datos, copias de seguridad y orquestación de la conmutación por error— en una estrategia probada y automatizada. Azure proporciona aislamiento de fallos por zona y región, distribución global basada en DNS y anycast, durabilidad de datos multirregional y copias de seguridad/restauración basadas en políticas para cumplir objetivos estrictos mientras se controla el costo y la complejidad operativa.
Arquitectura basada en RTO/RPO y resiliencia zonal/global
El diseño comienza con el RTO y el RPO. El RTO dicta la rapidez con la que un servicio debe reanudarse después de un fallo; el RPO dicta la máxima pérdida de datos aceptable. Cumplir con un RTO bajo requiere una conmutación por error automatizada y capacidad preaprovisionada; cumplir con un RPO bajo requiere replicación síncrona o casi síncrona y puntos de recuperación consistentes y frecuentes.
Las Availability Zones son dominios de error de centros de datos independientes dentro de una región. Los servicios zonales (por ejemplo, Virtual Machines, discos administrados, IP públicas Standard) están anclados a una única zona. Los servicios con redundancia de zona (por ejemplo, los frontends con redundancia de zona de Azure Load Balancer Standard, las ofertas de almacenamiento con redundancia de zona y los niveles de Azure SQL con redundancia de zona) se extienden por las zonas automáticamente. Un patrón resiliente típico despliega máquinas virtuales zonales en al menos dos zonas, las ubica en una única red virtual y expone un frontend de balanceo de carga con redundancia de zona. Esto elimina el fallo de una única zona como causa de tiempo de inactividad.
En el perímetro global, elija entre la distribución de carga basada en DNS y la basada en proxy anycast:
- Azure Traffic Manager está basado en DNS. Dirige a los clientes a los puntos de conexión utilizando métodos de enrutamiento: Rendimiento (latencia más baja), Ponderado (pruebas A/B y cambios graduales de tráfico), Prioridad (conmutación por error activa/pasiva), Geográfico (atender a los usuarios desde puntos de conexión que cumplen con la normativa regional), Multivalor (devuelve múltiples registros IPv4/IPv6 saludables para clientes simples) y Subred (asigna rangos de IP de clientes a puntos de conexión específicos). Al estar basado en DNS, Traffic Manager no acelera el contenido ni actúa como proxy para el tráfico; los clientes se conectan directamente al punto de conexión elegido y obedecen el comportamiento de caché de DNS local.
- Azure Front Door (Standard/Premium) es un proxy inverso global anycast para HTTP/HTTPS con enrutamiento inteligente, descarga de TLS y un firewall de aplicaciones web (WAF) integrado. Las reglas de enrutamiento buscan coincidencias por dominio, ruta, método y encabezados, y luego enrutan a grupos de origen; las acciones del motor de reglas pueden reescribir URL/encabezados e imponer redireccionamientos. Los sondeos de estado evalúan continuamente la salud del origen en una ruta y protocolo configurables; los orígenes no saludables se eliminan de la rotación. Los grupos de origen admiten la distribución por prioridad (activa/pasiva) y ponderada entre regiones. Las políticas de WAF se adjuntan en el punto de conexión o en la ruta, con conjuntos de reglas administradas, reglas personalizadas y limitación de velocidad para mitigar las amenazas de OWASP y los clientes abusivos. Use Front Door cuando necesite un balanceo de carga global con aceleración, seguridad en el perímetro y conmutación por error consciente de la aplicación; combínelo con Traffic Manager solo cuando necesite puntos de conexión que no sean HTTP o control a nivel de DNS.
En la capa 4, Azure Load Balancer proporciona una distribución de carga de latencia ultrabaja para TCP/UDP. Standard Load Balancer admite frontends zonales y con redundancia de zona, puertos de alta disponibilidad (HA ports), reglas de salida y un comportamiento seguro por defecto (configuración explícita de NSG y del grupo de backend). Los sondeos de estado (TCP/HTTP) determinan la salud del backend; un fallo elimina las instancias de la rotación. Basic Load Balancer carece de reconocimiento de zona, características avanzadas y un SLA; evítelo para producción. Cross-region Load Balancer añade un frontend global anycast que balancea la carga entre los balanceadores de carga Standard regionales, permitiendo diseños multirregionales activos/activos para cargas de trabajo que no son HTTP y proporcionando una conmutación por error regional rápida basada en el estado de salud.
Protección de datos y recuperación ante desastres: Azure Backup y Site Recovery
Azure Backup proporciona recuperación a un momento dado; Azure Site Recovery (ASR) ofrece replicación de cargas de trabajo y conmutación por error orquestada. Abordan necesidades complementarias y a menudo se combinan.
Opciones de almacén de Azure Backup:
- El almacén de Recovery Services protege Azure VMs, SQL Server en Azure VMs, SAP HANA en Azure VMs, Azure Files y agentes MARS/MABS. Se integra con directivas de copia de seguridad que definen programaciones, retención y copias de seguridad coherentes con la aplicación donde sea compatible.
- El almacén de Backup es el almacén modernizado para cargas de trabajo más nuevas, como la copia de seguridad de Azure Disks y la copia de seguridad de Azure Blobs, que ofrece RBAC granular y almacenamiento de almacén con redundancia de zona en las regiones compatibles. Elija el tipo de almacén que se alinee con la carga de trabajo y el modelo de gobernanza.
Las directivas de copia de seguridad rigen cuándo se ejecutan las copias de seguridad, sus niveles de retención (diaria/semanal/mensual/anual) y la configuración de coherencia. La eliminación temporal añade un período de seguridad durante el cual los elementos de copia de seguridad eliminados se pueden recuperar, protegiendo contra la eliminación accidental o malintencionada. La restauración entre regiones permite restaurar desde la región secundaria cuando el almacenamiento del almacén utiliza opciones con redundancia geográfica; debe estar habilitada y está sujeta a la compatibilidad de características regionales y a la preparación del plano de datos.
Azure Site Recovery replica cargas de trabajo entre zonas o regiones y orquesta la recuperación ante desastres de extremo a extremo:
- Las directivas de replicación definen la frecuencia de las instantáneas, la retención de los puntos de recuperación, la cadencia de las instantáneas coherentes con la aplicación y los umbrales de alerta de RPO. Las directivas equilibran el ancho de banda de replicación, los costos de almacenamiento y la precisión de la recuperación.
- Los planes de recuperación proporcionan una conmutación por error ordenada de aplicaciones de varias capas con grupos (p. ej., base de datos, API, web), pasos previos y posteriores, y automatización a través de runbooks de Azure Automation, scripts o acciones manuales. Integre en el plan los cambios de DNS, las actualizaciones de puntos de conexión de Traffic Manager/Front Door y la configuración de la aplicación.
- La conmutación por error de prueba ejecuta una recuperación aislada utilizando una VNet de no producción o una red de prueba para validar los runbooks, el orden de arranque y el estado de la aplicación sin afectar a la producción ni a la replicación. Las pruebas regulares son esenciales para validar el RTO.
- La conmutación por recuperación (Failback) devuelve las cargas de trabajo al sitio o región original cuando está en buen estado. Después de la conmutación por error, vuelva a proteger la carga de trabajo en la nueva dirección principal, sincronice los cambios, programe una ventana de conmutación por recuperación planificada y verifique la replicación posterior a la conmutación por recuperación. Para escenarios de Azure a Azure, normalmente se conmuta por error entre regiones emparejadas y se invierte la replicación para restaurar la topología original cuando esté listo.
Continuidad de la capa de datos: Azure SQL, replicación de almacenamiento y Cosmos DB
Cada servicio de datos expone una semántica de durabilidad y conmutación por error distinta que debe alinearse con los requisitos de coherencia de la aplicación.
Azure SQL Database y Azure SQL Managed Instance:
- La georreplicación activa crea hasta cuatro secundarios legibles para bases de datos únicas o grupos elásticos. Ofrece replicación a nivel de base de datos con conmutación por error manual o controlada por API, lo que permite el escalado de lectura y la recuperación ante desastres. Es apropiada cuando se necesita control por base de datos y orquestación personalizada.
- Los grupos de conmutación por error automática crean un grupo de bases de datos (o una instancia administrada completa) que conmutan por error juntas con un punto de conexión de escucha. Simplifica la conmutación por error entre regiones y la gestión de la cadena de conexión, y admite la conmutación por error automática después de un período de gracia. Utilice grupos de conmutación por error para aplicaciones de múltiples bases de datos que requieren una conmutación por error coordinada y una conectividad de cliente simplificada.
- La redundancia de zona coloca réplicas en diferentes zonas dentro de una región para sobrevivir a fallos zonales sin recuperación entre regiones. Habilítela para los niveles que la admitan para mejorar la disponibilidad local sin alterar los perfiles de latencia.
Opciones de replicación de Azure Storage:
- GRS (almacenamiento con redundancia geográfica) replica los datos de forma asíncrona desde la región primaria (tres copias) a una región secundaria emparejada (tres copias). Durante el funcionamiento normal, las lecturas y escrituras se dirigen al primario.
- RA-GRS añade acceso de lectura al punto de conexión secundario para escenarios como informes de emergencia o análisis cuando el primario está degradado.
- GZRS (almacenamiento con redundancia de zona geográfica) combina ZRS en la región primaria para la durabilidad zonal con la replicación asíncrona a la región secundaria, mejorando tanto la resiliencia local como la regional.
- RA-GZRS añade acceso de lectura al secundario para las cuentas GZRS. Si la región primaria es irrecuperable, puede iniciar una conmutación por error de la cuenta a la secundaria. Después de la conmutación por error, la cuenta de almacenamiento se convierte en primaria en la región secundaria y normalmente vuelve a ser con redundancia local (hasta que la reconfigure). Espere cierto RPO (replicación asíncrona); las aplicaciones deben gestionar la idempotencia y la reconciliación después de la conmutación por error.
Azure Cosmos DB:
- Las escrituras en varias regiones permiten escrituras en cualquier región configurada con directivas de resolución de conflictos (la última escritura prevalece a través de una propiedad designada, personalizada o estrategias multimaestro). Esto reduce la latencia de escritura y aumenta la disponibilidad.
- La conmutación por error automática utiliza una lista de regiones priorizadas para promover una nueva región de escritura en caso de interrupción. Combinado con los niveles de coherencia elegidos (de Fuerte a Eventual), usted gestiona el equilibrio entre disponibilidad y coherencia.
- Los SLA cubren la disponibilidad, el rendimiento, la latencia y la coherencia. Con escrituras en varias regiones, Cosmos DB ofrece hasta un 99.999% de disponibilidad tanto para lecturas como para escrituras, asumiendo una configuración correcta de múltiples regiones. Diseñe los clientes utilizando el SDK con detección de puntos de conexión y reintentos para beneficiarse plenamente de estas garantías.
← Redes y Conectividad · Todos los dominios · Arquitectura de Seguridad y Zero Trust →
Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Aprueba tu examen →