Microsoft AZ-104: Azure Monitor, Copia de seguridad y Recuperación de sitios — Guía de estudio
Forma parte de la Microsoft Azure Administrator Associate AZ-104 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Microsoft, o realiza tests cronometrados en ExamRoll.io.
Descripción general
La excelencia operativa en Azure requiere que tres pilares funcionen en conjunto: telemetría observable, datos recuperables y planes de continuidad resilientes. Azure Monitor y su base de Log Analytics recopilan métricas y registros de alta fidelidad, impulsan alertas inteligentes y exponen el rendimiento de las aplicaciones. Azure Backup protege los datos de la plataforma y de IaaS con una recuperación basada en almacenes y dirigida por directivas, incluyendo capacidades de restauración instantánea para un tiempo de inactividad mínimo. Azure Site Recovery (ASR) replica las cargas de trabajo en sitios alternativos y orquesta la conmutación por error y la conmutación por recuperación para cumplir con los RPO/RTO del negocio. Servicios complementarios —Network Watcher para diagnósticos de red y Azure Service Health para el conocimiento de la plataforma— completan un conjunto de herramientas de administrador integral.
Azure Monitor y Log Analytics
Azure Monitor unifica las métricas y los registros de la plataforma. Las métricas son series temporales numéricas optimizadas para el análisis casi en tiempo real (alta cardinalidad, multidimensionales, granularidad de un minuto para la mayoría de los recursos). Use Metrics Explorer para la visualización y alertas de métricas casi en tiempo real con umbrales estáticos o dinámicos. Los registros son registros con esquemas enriquecidos almacenados en un área de trabajo de Log Analytics, consultados con Kusto Query Language (KQL) para investigación, paneles y alertas programadas (de registro).
La configuración de diagnóstico es el puente desde los recursos hasta los receptores de telemetría. En cada recurso de Azure, configure los ajustes de diagnóstico para elegir categorías (métricas de plataforma, registros de plataforma y registros de recursos) y enrutarlos a uno o más destinos:
- Área de trabajo de Log Analytics para análisis y alertas basadas en registros
- Cuentas de almacenamiento para retención a largo plazo y de bajo costo, y para cumplimiento normativo
- Event Hubs para la transmisión a SIEMs o herramientas de terceros
Diseñe las áreas de trabajo de Log Analytics de forma deliberada:
- Ámbito y acceso del área de trabajo: Use RBAC a nivel de área de trabajo y de tabla para alinearse con el mínimo privilegio y los límites operativos (por ejemplo, por entorno y región). Las consultas en el contexto del recurso permiten a los equipos consultar registros limitados a los recursos a los que tienen acceso, incluso si los registros están centralizados.
- Recopilación de datos: Prefiera el agente de Azure Monitor (AMA) con Reglas de Recopilación de Datos (DCRs) sobre los agentes heredados. Las DCRs definen qué recopilar (contadores de rendimiento, registros de eventos de Windows/Linux, syslog, registros de texto personalizados), desde qué máquinas y en qué tablas, permitiendo canalizaciones granulares por ámbito.
- Costo y retención: Controle el costo con retención por tabla, archivo y registros básicos cuando sea apropiado. Use el muestreo y el filtrado en el momento de la recopilación cuando sea posible.
- Orígenes de datos: Azure Activity Log, registros de recursos a través de la configuración de diagnóstico, VM insights y Container insights, registros de inicio de sesión y auditoría de Azure AD (a través de la configuración de diagnóstico), registros de flujo de Azure Firewall/NSG, registros de aplicaciones personalizadas y locales a través del agente de Azure Monitor.
El dominio de KQL es esencial. Ejemplos:
- Auditoría rápida:
undefined
- Clasificación de rendimiento:
undefined
- Tasa de errores:
undefined
Los grupos de acciones definen quién y qué responde a las alertas: correo electrónico/SMS/push/voz, webhooks seguros, conectores ITSM, Functions, Logic Apps y runbooks de Automation. Reutilice los grupos de acciones en las reglas de alerta y aplique un enrutamiento de incidentes coherente.
Azure Monitor admite múltiples tipos de alerta:
- Alertas de métricas: Evalúan las métricas de la plataforma o personalizadas con una cadencia casi en tiempo real con umbrales estáticos o umbrales dinámicos que aprenden las líneas de base normales.
- Alertas de registro (consulta programada): Ejecutan KQL sobre los datos del área de trabajo con la frecuencia configurada; se activan por el recuento de resultados o un agregado numérico. Útiles para patrones complejos entre recursos.
- Alertas del registro de actividad: Se activan por eventos del plano de control (por ejemplo, cuando se elimina una VM o cambia una asignación de roles). Estas no requieren un área de trabajo.
- Detección inteligente: Detección de anomalías y picos en la tasa de fallos principalmente para recursos de Application Insights; notifica automáticamente a los propietarios y puede integrarse con grupos de acciones.
Application Insights y Alertas
Application Insights instrumenta el código y la plataforma para proporcionar telemetría de la aplicación de extremo a extremo. Use cadenas de conexión y SDK de primera clase (.NET, Java, Node.js, Python) u OpenTelemetry para un seguimiento neutral del proveedor. Para los servicios PaaS (App Service, Functions, AKS), habilite la autoinstrumentación donde esté disponible para capturar solicitudes, dependencias, excepciones y seguimientos sin cambios en el código. Mantenga el contexto de seguimiento distribuido para correlacionar los saltos del cliente, la API y el backend.
Tipos de telemetría clave:
- Solicitudes: Operaciones entrantes con códigos de respuesta y duración
- Dependencias: Llamadas salientes (HTTP, SQL, colas) con duración y éxito
- Excepciones y Seguimientos: Errores y registros de diagnóstico con severidad
- Métricas: Contadores personalizados o estándar
- Vistas de página y tiempos del navegador: Rendimiento del front-end
- Eventos y mediciones personalizados: Señales específicas del dominio
Aplique el muestreo adaptativo para controlar el volumen de ingesta sin perder la fidelidad de la señal, y use Live Metrics Stream para obtener información de baja latencia durante los incidentes.
Las pruebas de disponibilidad validan la accesibilidad externa y el SLA:
- Pruebas estándar (ping de URL): Sondean puntos de conexión desde múltiples regiones de Azure, validan códigos de estado, ventanas de expiración de SSL, coincidencia de contenido y umbrales de tiempo de respuesta.
- Pruebas personalizadas: Use
undefined
en el código para flujos de trabajo sintéticos o puntos de conexión protegidos. Los fallos pueden producir automáticamente alertas conectadas a grupos de acciones.
Aumente las alertas con la detección inteligente en Application Insights para:
- Anomalías de fallos y degradación del rendimiento
- Fugas de memoria y anomalías de dependencias Estas características aprenden patrones típicos y reducen los falsos positivos, complementando las alertas basadas en umbrales.
Azure Backup
Un almacén de Recovery Services centraliza la gestión de copias de seguridad, las directivas y la recuperación. Ubique los almacenes en la misma región que los recursos protegidos (o en la región emparejada para escenarios de restauración entre regiones compatibles con el servicio). Refuerce la seguridad de los almacenes con la eliminación temporal (soft delete), la protección contra purga y la autorización multiusuario para operaciones críticas.
Las directivas de copia de seguridad definen las programaciones y la retención:
- Copia de seguridad de VM de Azure: Instantáneas diarias con retención a corto plazo, retención opcional a largo plazo semanal/mensual/anual; puntos de recuperación coherentes con la aplicación a través de VSS (Windows) o scripts de pre/post (Linux) cuando está habilitado.
- Copia de seguridad de Azure Files: Copias de seguridad diarias respaldadas por instantáneas de recurso compartido; retención según las necesidades del negocio; admite la restauración al recurso compartido original o a uno alternativo con recuperación a nivel de elemento.
- SQL Server en VM de Azure: Copias de seguridad completas (diarias/semanales), diferenciales (diarias) y de registros (con una frecuencia de hasta cada 15 minutos) que permiten la restauración a un momento dado (point-in-time). La protección automática descubre nuevas bases de datos.
La restauración instantánea (Instant Restore) acelera las recuperaciones de VM mediante el uso de instantáneas almacenadas localmente que se conservan durante un breve período antes de su almacenamiento profundo en el almacén. Los administradores pueden:
- Restaurar una VM completa (nuevo recurso de proceso) para minimizar el tiempo de recuperación
- Restaurar discos y volver a asociarlos a una VM existente para una reparación específica
- Realizar la recuperación de archivos y carpetas montando un punto de recuperación como un dispositivo iSCSI temporal en cualquier VM de la suscripción (si el rol lo permite), lo que posibilita restauraciones quirúrgicas después de eventos como el ransomware
Las consideraciones para la copia de seguridad de VM incluyen la exclusión de discos para datos no críticos, el manejo del cifrado (Azure Backup admite discos cifrados) y los modelos de coherencia (coherente con el bloqueo frente a coherente con la aplicación). La copia de seguridad de Azure Files aprovecha las instantáneas de almacenamiento, beneficiándose de una retención incremental y eficiente en el uso del espacio, y de la protección de eliminación temporal. La copia de seguridad de SQL en VM de Azure utiliza una extensión compatible con la carga de trabajo (workload-aware) coordinada por el almacén para producir cadenas de restauración compatibles y restaurables en grupos de disponibilidad Always On e instancias independientes.
Azure Site Recovery, Network Watcher y Service Health
ASR proporciona replicación de cargas de trabajo y recuperación orquestada:
- Orígenes de replicación: De VMware/Hyper-V/físico on-premises a Azure; de región a región de Azure. El Mobility service en las máquinas protegidas captura los cambios y los replica en el almacenamiento de caché/destino. Habilite la consistencia de varios discos para aplicaciones por niveles que comparten el orden de escritura.
- Configuración de destino: Precrear o asignar grupos de recursos, VNets/subredes, opciones de disponibilidad (zonas/conjuntos), tipos de discos administrados y convenciones de nomenclatura. Use la asignación de red y las actualizaciones de DNS para garantizar la accesibilidad después de la conmutación por error.
- Opciones de conmutación por error: Conmutación por error de prueba (validación aislada sin impacto en producción), Conmutación por error planeada (cero pérdida de datos con apagado del origen) y Conmutación por error no planeada (mejor esfuerzo durante interrupciones). Después de la conmutación por error, Reproteger para revertir la replicación; Conmutación por recuperación cuando el primario esté listo a través de servidores de procesos o replicación directa, dependiendo del origen.
- Planes de recuperación: Orquestar niveles de múltiples VM con grupos, pasos de aprobación manual y runbooks o scripts de Azure Automation (para el calentamiento de la aplicación, la reconfiguración del balanceador de carga y los cambios de DNS). Integrar secuenciación y tiempos de espera para lograr un RTO predecible.
Los objetivos de RPO/RTO guían la política:
- El RPO (pérdida de datos aceptable) se basa en la tasa de cambio, el rendimiento de la red y la frecuencia de replicación. Establezca umbrales de RPO para generar alertas de estado cuando se superen.
- El RTO (tiempo para la restauración del servicio) depende del tiempo de arranque, los pasos de orquestación, las actualizaciones de DNS/conexión y las operaciones del plano de datos (adjuntar disco). Ajuste los planes de recuperación, preaprovisione capacidad y use conmutaciones por error de prueba para validar que se cumplan los objetivos.
- La política de replicación define la cadencia de instantáneas coherentes con la aplicación y las ventanas de retención de puntos de recuperación para equilibrar el costo de almacenamiento, la flexibilidad de recuperación y el rendimiento.
Azure Network Watcher proporciona a los administradores diagnósticos de red precisos:
- Verificación de flujo de IP: Valida si un flujo es permitido o denegado por las reglas efectivas de un NSG en una NIC, identificando la regla específica que influye en la decisión.
- Siguiente salto: Calcula la decisión de enrutamiento para un destino dado (Internet, red virtual, aplicación virtual), revelando las rutas efectivas definidas por el usuario y las rutas del sistema.
- Solución de problemas de conexión: Ejecuta sondeos de extremo a extremo entre el origen y el destino a través de VNets y enlaces híbridos, informando la accesibilidad, la latencia y el salto donde ocurre la falla.
- Captura de paquetes: Captura paquetes en una NIC de VM con filtros (protocolo/puerto/IP), almacenados en una cuenta de almacenamiento o localmente, útil para la inspección profunda de problemas intermitentes. Requiere la extensión de Network Watcher en la VM.
Azure Service Health complementa la monitorización con conocimiento de la plataforma:
- Problemas del servicio: Eventos de interrupción y degradación en tiempo real que afectan a servicios y regiones seleccionados, con actualizaciones sobre la causa raíz y la mitigación.
- Mantenimiento planeado: Notificaciones sobre próximas ventanas de mantenimiento de la plataforma que pueden afectar las cargas de trabajo, con cronogramas y acciones requeridas.
- Avisos de estado: Avisos de mejores prácticas y seguridad que pueden requerir cambios de configuración. Cree alertas de Service Health limitadas a servicios/regiones/suscripciones y enrútelas a través de grupos de acciones para que los equipos de operaciones sean informados antes del impacto. Use Resource Health para el estado de disponibilidad por recurso (Disponible, Degradado, No disponible, Desconocido) para distinguir problemas de la plataforma de problemas de la carga de trabajo.
Escenario de Problema Práctico
Adobe debe fortalecer y poner en operación una nueva plataforma de comercio electrónico de dos regiones en Azure, cumpliendo estrictos objetivos de observabilidad, copia de seguridad y recuperación ante desastres, al tiempo que garantiza una rápida solución de problemas de red y conocimiento de la plataforma.
Desplegar un área de trabajo de Log Analytics central por región y adjuntar Reglas de Recopilación de Datos a todas las VM y nodos de AKS para recopilar registros de rendimiento, syslog/EventLog y registros específicos de recursos a través de la configuración de diagnóstico. Por qué: Las áreas de trabajo regionales preservan la residencia de datos y el rendimiento; AMA+DCR proporciona una recopilación granular y escalable, y control de costos.
Configurar los ajustes de diagnóstico en App Service, Key Vault, Azure Firewall, Application Gateway y Storage para enrutar registros y métricas al área de trabajo regional y a una cuenta de almacenamiento para retención a largo plazo. Por qué: El análisis centralizado permite la correlación entre recursos; la retención en almacenamiento satisface las necesidades de cumplimiento y forenses.
Instrumentar los niveles web y de API con Application Insights usando OpenTelemetry y habilitar la autoinstrumentación en App Service. Crear pruebas de disponibilidad desde al menos cinco regiones de Azure con comprobaciones de coincidencia de contenido y caducidad de TLS. Por qué: El seguimiento distribuido profundo y las pruebas sintéticas detectan regresiones que impactan al usuario antes que los clientes.
Crear alertas de Azure Monitor:
- Alertas de métricas dinámicas para CPU, memoria, tasas de HTTP 5xx y estado del backend de App Gateway
- Alertas de consulta programada para denegaciones anómalas del firewall e inicios de sesión fallidos usando KQL
- Alertas de registro de actividad para eventos de eliminación/asignación de roles en recursos críticos
- Conectar todas las alertas a grupos de acciones compartidos (correo electrónico/SMS para el personal de guardia, webhook a ITSM, Logic App para abrir incidentes) Por qué: Las alertas de múltiples señales reducen el tiempo medio de detección con un enrutamiento procesable hacia personas y sistemas.
- Proteger datos con Azure Backup:
- Habilitar la copia de seguridad de VM con políticas alineadas con copias de seguridad nocturnas y retención a largo plazo; habilitar instantáneas coherentes con la aplicación cuando sea aplicable
- Proteger los recursos compartidos de Azure Files que alojan activos multimedia con copias de seguridad diarias y eliminación temporal (soft delete)
- Proteger SQL Server en VM de Azure con programaciones de copias completas/diferenciales/de registro para admitir la restauración a un momento dado
- Validar Instant Restore realizando una restauración a nivel de archivo en un entorno de ensayo (staging) Por qué: Las copias de seguridad basadas en almacén y las restauraciones instantáneas minimizan el tiempo de inactividad y la pérdida de datos en cargas de trabajo de IaaS y de archivos.
Implementar Azure Site Recovery para la recuperación ante desastres (DR) de región a región de los niveles web, de API y de SQL con una política de replicación que apunte a un RPO bajo y puntos de coherencia de aplicación por hora. Construir un plan de recuperación con niveles (primero datos, luego API, luego web), automatización para actualizar el DNS y purgar las cachés de CDN, y realizar una conmutación por error de prueba en una VNet aislada trimestralmente. Por qué: La replicación y los planes de recuperación de ASR proporcionan un RTO predecible con runbooks orquestados y auditables, y pruebas no disruptivas.
Habilitar Network Watcher y usar la Solución de problemas de conexión para validar los flujos del frontend al backend, Siguiente salto para verificar las UDR a través del nivel de NVA, y la Verificación de flujo de IP para confirmar el fortalecimiento de los NSG. Configurar la captura de paquetes bajo demanda en las VM de la API para el análisis de tiempos de espera intermitentes. Por qué: Los diagnósticos especialmente diseñados aíslan rápidamente los problemas de enrutamiento/NSG y proporcionan evidencia a nivel de paquete cuando es necesario.
Crear alertas de Azure Service Health para las dos regiones y los servicios en el ámbito (App Service, SQL, Storage, Key Vault, Front Door). Enrutarlas a los mismos grupos de acciones e incluir listas de distribución de liderazgo para los avisos de mantenimiento planeado. Por qué: El conocimiento proactivo de los incidentes y el mantenimiento de la plataforma previene interrupciones inesperadas y permite una comunicación coordinada.
Este enfoque integrado garantiza que Adobe cumpla sus objetivos de RPO/RTO, se recupere rápidamente de un ransomware o un error del operador, detecte y solucione anomalías en minutos, y pueda solucionar de manera concluyente las rutas de red mientras se mantiene informado de los eventos de la plataforma Azure.
← Bases de datos de Azure y Servicios de datos · Todos los dominios · Seguridad de Azure y Cumplimiento →
Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Aprueba tu examen →