Microsoft AZ-500: Respuesta a incidentes, recuperación y resiliencia — Guía de estudio
Forma parte de la Microsoft Azure Security Engineer Associate AZ-500 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Microsoft, o realiza tests cronometrados en ExamRoll.io.
Información general
La respuesta a incidentes, la recuperación y la resiliencia en Azure son una capacidad continua que combina procedimientos operativos bien ensayados con controles nativos de la plataforma. Un programa eficaz anticipa fallos o compromisos, detecta y clasifica rápidamente, contiene el radio de impacto con automatización, restaura el servicio según objetivos definidos, preserva evidencia inmutable y luego fortalece el entorno basándose en lo aprendido. Los servicios nativos de Azure —Microsoft Sentinel, Defender for Cloud, Logic Apps, Azure Backup, Azure Site Recovery (ASR), DDoS Protection, Web Application Firewall (WAF), Traffic Manager/Front Door y Microsoft Entra— proporcionan los componentes básicos. El imperativo de diseño es preconfigurar la telemetría adecuada, las rutas de emergencia para identidades (break-glass) y la aplicación de políticas automatizada para que los equipos puedan ejecutar en minutos, no en horas.
Ciclo de vida de la respuesta a incidentes y operaciones de Sentinel
Preparación
- Definir quién hace qué, cuándo y con qué herramientas. Preaprovisionar espacios de trabajo de Microsoft Sentinel, conectar fuentes de datos (Activity Log, registros de recursos, registros de flujo de NSG, registros de auditoría/inicio de sesión de Microsoft Entra, señales de Defender) e implementar controles de acceso y RBAC para analistas, personal de respuesta y comandantes de incidentes.
- Crear playbooks (Logic Apps) para acciones de contención comunes como el aislamiento de VM, la revocación de tokens de usuario o la rotación de claves. Preconfigurar NSG de cuarentena y suscripciones dedicadas para análisis forense.
- Establecer la retención de registros inmutables a través de Diagnostic Settings hacia Log Analytics y una cuenta de Azure Storage con inmutabilidad (WORM).
Detección
- En Sentinel, habilitar reglas de análisis para el robo de credenciales, patrones de inicio de sesión inusuales, ejecución de procesos sospechosos, abuso de Key Vault y exfiltración de datos. Complementar con reglas de UEBA y de fusión para correlacionar eventos benignos en incidentes significativos. Calibrar los umbrales de las reglas y la supresión para minimizar la fatiga por alertas.
Contención
- Ejecutar acciones preaprobadas: poner en cuarentena las NIC a través de un NSG, deshabilitar service principals comprometidos, revocar tokens de actualización de Entra, rotar secretos, deshabilitar puntos de conexión públicos de entrada o poner el WAF en modo de prevención. Usar reglas de automatización de Sentinel para enrutar por severidad, agregar etiquetas, asignar propietarios y desencadenar playbooks.
Erradicación
- Eliminar la persistencia (tareas de inicio, trabajos programados, scripts de cloud-init, extensiones maliciosas), rotar credenciales, redesplegar imágenes base (golden images) y aplicar parches a las vulnerabilidades señaladas por Defender for Cloud. Para incidentes relacionados con la identidad, exigir el restablecimiento de contraseñas y fortalecer el Acceso Condicional (Conditional Access).
Recuperación
- Restaurar desde Azure Backup a VNet limpias; realizar la conmutación por error (fail over) utilizando planes de recuperación de ASR; validar la integridad y rehidratar secretos y configuraciones desde fuentes confiables (plantillas de IaC, Key Vault con eliminación temporal/protección contra purga). Asegurar que se cumplan el RTO y el RPO.
Lecciones aprendidas
- Realizar una revisión post-mortem sin culpabilizar (blameless review). Actualizar reglas y playbooks de Sentinel, asignaciones de Azure Policy, imágenes base y runbooks. Codificar las remediaciones en IaC y aplicarlas a través de grupos de administración.
Clasificación, recolección de evidencia, investigación y gestión de casos en Sentinel
Clasificación (Triage)
- Priorizar incidentes por severidad, criticidad del activo y radio de impacto utilizando el enriquecimiento de entidades (host, usuario, IP) y watchlists. Usar la agrupación de incidentes para reducir duplicados y la vista de línea de tiempo para comprender la secuencia.
Recolección de evidencia
- Marcar eventos notables, exportar registros sin procesar a almacenamiento inmutable, tomar instantáneas de los discos de VM afectadas para análisis sin conexión y capturar árboles de procesos a través de integraciones con Defender for Endpoint. Preservar la cadena de custodia almacenando hashes y limitando el acceso a un grupo de recursos de análisis forense.
Investigación
- Utilizar los gráficos de investigación y las páginas de entidad (historial de inicio de sesión del usuario, árbol de procesos del host). Realizar búsquedas (hunting) con KQL en SigninLogs, AuditLogs, SecurityEvent y AzureDiagnostics. Registrar hallazgos, adjuntar artefactos y etiquetar IOC para futuras detecciones.
Gestión de casos
- Estandarizar estados (Nuevo, Activo, En Progreso, Resuelto), propietarios y temporizadores de SLA. Integrar Sentinel con ITSM (ServiceNow/Azure DevOps) para la gestión de tickets y el control de cambios. Las reglas de automatización pueden cerrar automáticamente alertas benignas conocidas o escalar tácticas específicas al Nivel 2.
Contención automatizada y orquestación de flujos de trabajo
Reglas de automatización de Sentinel
- Se activan en la creación/actualización de un incidente. Asignan dinámicamente la propiedad, establecen la severidad, agregan etiquetas (p. ej., QuarantineCandidate) e invocan uno o más playbooks. Justificación: pasar de la detección a la acción en segundos, de forma consistente con el principio de privilegio mínimo y los playbooks preaprobados.
Playbooks de Logic Apps
- Acciones comunes: aplicar un NSG de cuarentena a la NIC de una VM, deshabilitar un usuario, revocar tokens, bloquear una IP en el WAF o abrir un ticket de ITSM con el contexto completo. Usar identidades administradas y Azure RBAC para limitar los permisos de cada playbook al conjunto exacto de recursos.
Automatización de flujos de trabajo de Defender for Cloud
- Ante recomendaciones o alertas (p. ej., “RDP abierto a Internet”), desencadenar automáticamente playbooks para remediar (restringir reglas de NSG), etiquetar recursos para seguimiento o notificar a los propietarios. Justificación: cerrar la exposición rápidamente, mejorando el Secure Score y reduciendo el tiempo de permanencia del atacante.
Ejemplo: poner en cuarentena la NIC de una VM en segundos
# Create a high-priority deny-all inbound NSG rule and associate a quarantine NSG to the NIC
az network nsg rule create -g rg-prod -n QuarantineDenyAll --nsg-name nsg-quarantine \
--priority 100 --access Deny --direction Inbound --protocol '*' --source-address-prefixes '*' \
--source-port-ranges '*' --destination-address-prefixes '*' --destination-port-ranges '*'
az network nic update -g rg-prod -n vm1-nic --network-security-group nsg-quarantine
Revocación de tokens para un usuario comprometido
az rest --method POST \
--uri "https://graph.microsoft.com/v1.0/users/user@contoso.com/revokeSignInSessions"
Copias de seguridad, replicación, RTO/RPO y resiliencia
Seguridad de Azure Backup
Almacenes de Recovery Services y almacenes de Backup
- Use almacenes por cada límite de carga de trabajo y región. Habilite la eliminación temporal (soft delete) para proteger contra la eliminación accidental o maliciosa de elementos de copia de seguridad; establezca una ventana de retención adecuada y alineada con las necesidades regulatorias. Habilite la protección contra purga (donde sea compatible) para evitar eliminaciones irreversibles.
Inmutabilidad
- Configure la inmutabilidad del almacén. Use el modo desbloqueado durante el ajuste inicial y luego cambie al modo bloqueado para evitar la reducción de la retención o la manipulación de políticas. Justificación: asegura que las copias de seguridad sean de escritura única y a prueba de modificaciones, un control clave contra el ransomware.
Autorización multiusuario (MUA)
- Proteja las operaciones críticas de copia de seguridad (p. ej., detener la protección con eliminación de datos, cambiar la configuración del almacén) usando Azure Backup Resource Guard en una suscripción/grupo de recursos separado que sea propiedad de un equipo diferente. Justificación: impone la separación de funciones; los atacantes deben comprometer dos identidades en ámbitos diferentes para destruir la capacidad de recuperación.
Capacidades entre regiones
- Para RSV que usan GRS, habilite la restauración entre regiones para poder recuperar incluso si la región principal no está disponible. Valide que las claves criptográficas utilizadas por las cargas de trabajo también sean resilientes (eliminación temporal/protección contra purga de Key Vault y, si es necesario, planificación de recuperación con redundancia geográfica).
Azure Site Recovery (ASR)
Replicación
- De Azure a Azure, de VMware/Hyper-V a Azure y servidores físicos. Defina políticas de replicación (umbral de RPO, retención de puntos de recuperación, frecuencia de instantáneas coherentes con la aplicación). Implemente el servicio Mobility donde sea necesario.
Planes de recuperación
- Orqueste la conmutación por error (failover) de aplicaciones de varias capas con orden de arranque, pasos manuales y runbooks (p. ej., actualizaciones de DNS, cambios de cadenas de conexión). Mantenga las credenciales y los scripts en Key Vault.
Prueba de conmutación por error
- Realice pruebas regulares y no disruptivas en una VNet aislada con IP enmascaradas. Use “Limpiar prueba de conmutación por error” para restablecer el estado. Justificación: valida la recuperación de extremo a extremo sin afectar a la producción.
Conmutación por recuperación (Failback)
- Después de la recuperación del sitio principal, vuelva a proteger y realice la conmutación por recuperación (failback), resincronizando los cambios. Planifique ventanas de ancho de banda y mantenimiento para cumplir con los SLA del negocio.
Selección de la arquitectura para cumplir con RTO/RPO
RPO estricto (segundos a minutos) y RTO bajo (minutos)
- Prefiera ASR o la replicación nativa de aplicaciones (p. ej., SQL Always On, Cosmos DB multirregión) en lugar de copias de seguridad; mantenga un standby activo (hot) o templado (warm); use Front Door/Traffic Manager para la conmutación por error regional.
RPO moderado (horas) y RTO (horas)
- Combine copias de seguridad frecuentes con ASR para las capas críticas; use funciones de aceleración de copia de seguridad (instantáneas de restauración instantánea) para reducir el tiempo de restauración.
RPO largo (días) y RTO (días)
- Solo copias de seguridad con retención más larga; niveles de archivo optimizados en costos.
Razonamiento operativo: la replicación ofrece un RPO bajo a un costo continuo más alto; las copias de seguridad ofrecen una retención a largo plazo más económica pero con un RTO/RPO más lento. Combine por cada capa para que coincida con el análisis de impacto en el negocio.
Defensa de red, análisis forense, continuidad y fortalecimiento
Respuesta a DDoS en Azure, ajuste de WAF y conmutación por error en la gestión de tráfico
DDoS Protection Standard
- Asócielo con VNets que alojen IP públicas. Proporciona mitigación adaptativa en tiempo real y soporte de DDoS Rapid Response (DRR) durante los ataques. Configure alertas y diagnósticos hacia Sentinel. Justificación: mitigación automática en el perímetro antes de que el tráfico llegue a las cargas de trabajo.
Ajuste de WAF
- Utilice conjuntos de reglas OWASP administradas y cambie al modo de prevención. Añada exclusiones para patrones benignos conocidos, active la inspección del tamaño/cuerpo de la solicitud donde sea necesario y cree reglas personalizadas para permitir/denegar y limitar la velocidad (rate limiting) en IP o geografías abusivas. Refine continuamente basándose en los registros.
Conmutación por error del tráfico
- Utilice Traffic Manager (basado en DNS) con enrutamiento prioritario y un TTL bajo para la conmutación por error entre regiones, o Azure Front Door (anycast L7) para una conmutación por error más rápida impulsada por sondeos de estado y una entrada global. Sondee los puntos de conexión críticos y realice simulacros de conmutación por error con regularidad.
Análisis forense: registros y retención inmutable
Activity Log
- Audite las acciones del plano de control (crear/eliminar/asignaciones de roles). Transmita a Sentinel y a Azure Storage con inmutabilidad para retención legal (legal hold).
Registros de recursos
- Habilite a través de Diagnostic Settings para servicios clave (Key Vault, App Service, Storage, SQL, AKS). Enrute a Log Analytics, Event Hub y Storage inmutable.
Registros de flujo de NSG
- Habilite en Network Watcher; analice con Traffic Analytics para reconstruir los flujos de red durante los incidentes.
Registros de auditoría e inicio de sesión de Microsoft Entra
- Ingiéralos en Sentinel para investigaciones de identidad. Supervise los inicios de sesión de riesgo y los resultados del acceso condicional. Extienda la retención a través del archivo de Log Analytics y/o exporte a Storage inmutable.
Controles de emergencia (break-glass) y de continuidad
- Mantenga al menos dos cuentas de emergencia (break-glass) de tipo Global Administrator exclusivas de la nube con contraseñas largas y complejas, excluidas de las políticas de Acceso Condicional y MFA para sobrevivir a interrupciones. Almacene las credenciales de forma segura fuera de línea y supervise cualquier inicio de sesión con alertas en tiempo real. Asigne roles permanentes limitados en otros lugares; utilice PIM para la elevación justo a tiempo (just-in-time) durante las operaciones normales.
- Documente los procedimientos de acceso de emergencia, incluyendo la opción de Entra “Elevar el acceso para administrar todas las suscripciones de Azure” y los pasos para asignar el rol de Owner en el grupo de administración raíz si el RBAC está roto.
- Proteja los activos críticos con bloqueos de administración (CanNotDelete) y restrinja el alcance de la asignación de roles utilizando grupos de administración.
Fortalecimiento post-incidente
- Aplique Azure Policy en los grupos de administración para hacer cumplir una línea base (p. ej., DeployIfNotExists para extensiones antimalware, cifrado de disco, configuraciones de diagnóstico, acceso JIT a VM). Corrija el incumplimiento con tareas de corrección de directivas (policy remediation tasks).
- Mejore la detección ajustando los análisis de Sentinel (añada nuevos IOC, ajuste umbrales), convirtiendo las búsquedas (hunts) exitosas en reglas programadas y añadiendo reglas de automatización para el triaje.
- Actualice las líneas base de seguridad (imágenes, políticas de Key Vault, reglas de NSG/WAF). Capture todos los cambios como código (Bicep/Terraform) y valídelos con CI/CD y control de cambios. Realice un seguimiento del Secure Score y del cumplimiento normativo para medir el progreso.
Escenario de un problema práctico
Starbucks experimenta un aumento de inicios de sesión sospechosos seguido de una salida anómala de datos de almacenamiento desde una suscripción de producción que aloja una API de pedidos. El equipo de seguridad debe contener, investigar y restaurar el servicio mientras preserva la evidencia y cumple con un RTO de dos horas y un RPO de 15 minutos para la capa de la API.
- Automatizar el triaje y contener el radio de impacto
- En Sentinel, una regla de automatización se activa ante incidentes de alta gravedad con entidades del grupo de recursos de la API de pedidos, asigna al analista de guardia, etiqueta el incidente como QuarantineCandidate y ejecuta un playbook para:
- Revocar las sesiones del usuario comprometido.
- Aplicar un NSG de cuarentena a las NIC del conjunto de escalado de máquinas virtuales (VM scale set) de la API.
- Añadir una regla personalizada de WAF para bloquear los rangos de IP infractoras.
- Justificación: La automatización ejecuta acciones preaprobadas y de mínimo privilegio en segundos, reduciendo el tiempo de permanencia del atacante y evitando una mayor fuga de datos.
- Preservar la evidencia con inmutabilidad
- El playbook crea instantáneas (snapshots) de los discos de SO/datos de las VM afectadas y exporta el Activity Log, los registros de flujo de NSG y los registros de la cuenta de Storage para los contenedores objetivo a una cuenta de Azure Storage con inmutabilidad basada en tiempo y retención legal (legal hold). Se adjuntan marcadores (bookmarks) y consultas KQL al incidente de Sentinel.
- Justificación: El almacenamiento inmutable garantiza la cadena de custodia; las instantáneas permiten el análisis forense fuera de línea sin alterar los sistemas comprometidos.
- Recuperar el servicio para cumplir con RTO/RPO
- Debido a que la capa de la API está protegida por ASR con una frecuencia de instantáneas coherentes con la aplicación de 15 minutos, el equipo ejecuta un plan de recuperación priorizado para conmutar por error la capa de la API a la región emparejada. Azure Front Door realiza la conmutación por error basada en sondeos de estado hacia el punto de conexión secundario.
- Justificación: La replicación cumple con el RPO de 15 minutos, y la conmutación por error orquestada más el enrutamiento de Front Door cumplen con el RTO de dos horas sin necesidad de restaurar desde una copia de seguridad.
- Remediar la identidad y los secretos
- Los administradores con privilegios rotan las credenciales y claves en Key Vault (con eliminación temporal y protección contra purga habilitadas) y deshabilitan la cuenta comprometida, aplicando un Acceso Condicional más estricto para los roles con privilegios.
- Justificación: Los secretos y la identidad son vectores de persistencia comunes; la rotación rápida y los controles de acceso más estrictos impiden el reingreso del atacante.
- Fortalecimiento y validación post-incidente
- El equipo ajusta las reglas administradas de WAF, añade una regla personalizada de limitación de velocidad (rate-limiting), incorpora la cuenta de Storage a Defender for Cloud con alertas de anomalías y despliega Azure Policy para hacer cumplir las configuraciones de diagnóstico y las líneas base de NSG por defecto. Se añade una regla de análisis de Sentinel para detectar patrones de salida de datos similares, y se programa un simulacro para validar los planes de recuperación de ASR trimestralmente.
- Justificación: Institucionalizar las correcciones a través de directivas y análisis reduce la recurrencia y garantiza que la resiliencia se mantenga verificable y repetible.
← Seguridad híbrida y multinube · Todos los dominios
Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Aprueba tu examen →