Microsoft AZ-305: Monitoreo, Optimización de Costos y Operaciones — Guía de estudio
Forma parte de la Microsoft Azure Solutions Architect Expert AZ-305 — Guía de estudio. Practica con respuestas verificadas en el centro de exámenes de Microsoft, o realiza tests cronometrados en ExamRoll.io.
Información general
Un diseño robusto de monitorización y operaciones de Azure establece una estructura de telemetría única, alertas procesables, costos gobernados e informes de cumplimiento para toda la flota. La solución abarca las métricas y los registros de Azure Monitor, Log Analytics y Kusto Query Language (KQL), Application Insights para la telemetría de aplicaciones y la gobernanza operativa a través de Azure Policy, Azure Resource Graph y Advisor. El control de costos se refuerza mediante Azure Cost Management, mientras que la fiabilidad de la plataforma y la conciencia de los cambios dependen de Azure Service Health. Azure Automation cierra el ciclo con remediación repetible y orquestación de actualizaciones. Los Workbooks unifican la información de todos estos servicios para obtener visibilidad operativa.
Observabilidad con Azure Monitor, Application Insights y Workbooks
Azure Monitor recopila telemetría de la plataforma y las cargas de trabajo, almacenando métricas de series temporales y datos de registro. Las métricas son valores ligeros y casi en tiempo real, adecuados para umbrales y seguimiento de SLO (p. ej., CPU, tasa de errores HTTP 5xx). Los registros capturan telemetría estructurada y consultable que permite la correlación y el análisis de causa raíz. Diseñe alertas de métricas para la detección rápida de síntomas y alertas de registro para una detección más rica y basada en condiciones usando KQL.
Los grupos de acciones (Action groups) desacoplan la detección de la respuesta. Asocie correos electrónicos/SMS/voz, notificaciones push, webhooks seguros, conectores ITSM, Azure Functions, Logic Apps y runbooks de Azure Automation. Utilice grupos de acciones separados para producción y no producción, y aplique programaciones de supresión durante el mantenimiento planificado. Dirija las alertas a la gestión de incidentes con cargas útiles (payloads) consistentes e incluya el contexto del recurso y enlaces a runbooks.
La configuración de diagnóstico (Diagnostic settings) es obligatoria para lograr una visibilidad completa. Habilítelos en los ámbitos de recurso, grupo de recursos y suscripción para exportar métricas y registros de recursos (p. ej., Activity, Administrative, Policy, Security, NetworkSecurityGroupFlowEvent) a Log Analytics para consultas, a almacenamiento para retención en frío (cold retention) y a Event Hubs para su transmisión a sistemas SIEM. Configure siempre una configuración de diagnóstico a nivel de suscripción en el Activity Log para poder informar sobre implementaciones y evaluaciones de políticas, y generar informes de cambios mensuales.
Application Insights añade observabilidad profunda de las aplicaciones. Instrumente con el SDK u OpenTelemetry para el seguimiento distribuido, dependencias, solicitudes, excepciones y eventos personalizados. Utilice la autoinstrumentación en App Services, Functions, AKS y VM/VMSS a través del agente de Azure Monitor donde sea compatible para minimizar los cambios en el código. Las pruebas de disponibilidad (Availability tests) simulan el tráfico de usuarios desde múltiples regiones; configure la frecuencia, las ubicaciones de prueba, las comprobaciones SSL/HTTP y los criterios de éxito. Smart Detection utiliza análisis integrados para señalar patrones de anomalías, como picos repentinos de fallos y degradación del rendimiento. El muestreo (Sampling) controla la ingesta y el costo preservando la fidelidad estadística; aplique el muestreo adaptativo para tráfico dinámico o el muestreo de tasa fija para análisis determinista, y excluya las transacciones críticas del muestreo cuando el cumplimiento requiera una captura completa.
Los Azure Monitor Workbooks proporcionan paneles interactivos y parametrizados que unifican métricas, registros y señales de costos en un único artefacto. Utilice parámetros para la suscripción, la región, el entorno y el intervalo de tiempo para permitir la reutilización en todas las zonas de aterrizaje (landing zones). Combine visualizaciones con texto narrativo para estandarizar los playbooks operativos y los “runbooks-on-a-page”. Almacene los workbooks en grupos de recursos, aplique RBAC para un acceso controlado y cree plantillas JSON para implementaciones de infraestructura como código.
Log Analytics y KQL a escala
Un área de trabajo de Log Analytics (Log Analytics workspace) es el punto de agregación central para los registros de Azure Monitor. Elija un área de trabajo regional y centralizada según los requisitos de residencia de datos, o un diseño federado con una por cada zona de aterrizaje (landing zone) cuando se necesite una soberanía de datos estricta o segmentación por RBAC. Para grandes empresas, prefiera un hub (área de trabajo compartida) más áreas de trabajo spoke selectivas para dominios sensibles o de alto volumen. Alinee los planes de tabla con el valor de los datos: utilice tablas de Analytics para datos de seguridad y operaciones de alto valor; Basic Logs para registros detallados y de bajo valor con acceso de solo búsqueda; y Archive para retención a largo plazo y de bajo costo con Search Jobs para su recuperación.
Las Reglas de Recopilación de Datos (DCRs) definen lo que recopila el Azure Monitor Agent (AMA), incluyendo registros de syslog/eventos, contadores de rendimiento, canales de eventos de Windows y registros de texto personalizados. Utilice DCRs distintas por tipo de sistema operativo y rol, y gestione el ámbito a través de VMSS, conjuntos de escalado (scalesets) y Azure Arc para entornos híbridos. Prefiera las tablas personalizadas basadas en DCRs sobre las API de ingesta heredadas para una mejor gobernanza y consistencia.
La retención debe equilibrar las ventanas de investigación con el costo. Aplique la retención por tabla para los datos calientes (hot data) utilizados en las operaciones diarias (p. ej., 30–90 días) y archive los datos de cola larga (long-tail data) (p. ej., 6–24 meses) para cumplimiento y búsqueda de amenazas (threat hunting). Supervise el volumen de ingesta, las tablas más “ruidosas” (top noisy tables) y aplique muestreo o filtrado en las DCRs para evitar la recopilación de registros redundantes. Utilice los niveles de compromiso (commitment tiers) para optimizar el costo de ingesta cuando sea predecible.
KQL es la lingua franca operativa. Domine los filtros (where), las transformaciones (extend, project), la agrupación por tiempo (bin/1m), las agregaciones (summarize by), las uniones (joins: inner/leftouter) y la renderización (render timechart). Cree consultas programadas para alertas de registro con controles de limitación (throttling), dimensiones de división (split-by) para alertas de alta cardinalidad y umbrales dinámicos para alertas basadas en una línea base (baselined alerts). Las vistas materializadas y la optimización del rendimiento de las consultas (p. ej., proyectar y descartar columnas no utilizadas tempranamente, reducir la ventana de tiempo) garantizan consultas rentables. Para los informes de implementación de ARM, consulte AzureActivity o el historial de cambios de Azure Resource Graph exportado a Log Analytics y correlaciónelo con los eventos de Policy para el análisis de gobernanza.
Costo, Estado, Advisor, Resource Graph y Cumplimiento de Directivas
Azure Cost Management permite una gobernanza proactiva. Los presupuestos con ámbito en suscripciones, grupos de recursos o grupos de administración desencadenan alertas en umbrales acumulativos (p. ej., 50 %, 80 %, 100 %). Vincule las alertas de presupuesto a grupos de acciones para ejecutar Logic Apps o Functions que etiqueten, reduzcan la escala o incluso pongan en cuarentena recursos no críticos. Utilice el Análisis de costos para crear vistas amortizadas, agrupar por etiqueta (centro de costos, propietario) e identificar anomalías por servicio o región. Las recomendaciones de Reservas y Planes de Ahorro exponen oportunidades de compromiso para VMs, SQL, Cosmos DB y más. Evalúe el ámbito de compra (suscripción única o compartida), el plazo (1 o 3 años) y la coincidencia de cobertura (flexibilidad de tamaño de instancia, Azure Hybrid Benefit).
Azure Advisor evalúa continuamente las suscripciones y los recursos, produciendo recomendaciones priorizadas en las áreas de costo (ajuste de tamaño, recursos inactivos, reservas), seguridad (a través de Defender for Cloud), confiabilidad (redundancia de zona, postura de copia de seguridad/restauración), rendimiento (escalado, orientación de SKU) y excelencia operativa (higiene de etiquetas, adopción de directivas). Realice un seguimiento del Advisor Score para cuantificar la postura e impulsar los backlogs de ingeniería.
Azure Service Health operacionaliza la conciencia de la plataforma. Los problemas del servicio capturan incidentes en vivo; el mantenimiento planificado comunica los próximos cambios en la plataforma; los avisos de estado incluyen obsolescencias y mejores prácticas. Configure alertas de estado del servicio con grupos de acciones, filtrando por suscripción, región y servicio. Combine Service Health con Resource Health para distinguir las fallas de la plataforma de los problemas de la carga de trabajo para una clasificación precisa de incidentes.
Azure Resource Graph proporciona inventario y análisis de cumplimiento para todo el tenant con consultas de baja latencia y a escala utilizando una sintaxis similar a KQL. Consulte a través de miles de suscripciones para enumerar la deriva de recursos, los activos sin etiquetar, las configuraciones inseguras o los SKU no compatibles. Una los resultados de Resource Graph con los recursos de cumplimiento de Policy para producir resúmenes acumulativos a nivel de grupo de administración, incluyendo excepciones y la última hora de evaluación. Utilice el seguimiento de cambios (donde esté disponible) para capturar deltas de propiedades para análisis forense.
Azure Policy impone barreras de protección y mide el cumplimiento. Asigne directivas e iniciativas en los ámbitos de grupo de administración, suscripción o grupo de recursos. Comprenda los estados de cumplimiento: conforme, no conforme, en conflicto, error y exento. Utilice exenciones con justificación y vencimiento para modelar la aceptación de riesgos sin sesgar las métricas de cumplimiento, y excluya solo el ámbito mínimo necesario. Para los efectos deployIfNotExists y modify, configure tareas de corrección respaldadas por una identidad administrada con permisos de privilegios mínimos. Supervise el estado del trabajo de corrección, las fallas y las operaciones en el panel de cumplimiento y en el Activity Log; establezca alertas sobre el incumplimiento persistente. Combine las evaluaciones de Policy con Resource Graph y Workbooks para presentar paneles de gobernanza a nivel ejecutivo.
Automatización y gestión de parches
Azure Automation orquesta tareas repetibles. Cree runbooks en PowerShell o Python, que se pueden desencadenar por programaciones, webhooks, disparadores basados en eventos o alertas. Use Hybrid Runbook Workers para ejecutar la automatización cerca de los recursos en redes privadas u otras nubes, gobernados por Azure Arc. Implemente módulos estandarizados y manejo de errores, y almacene los secretos en Key Vault.
Update Management garantiza que los sistemas operativos estén actualizados. Las organizaciones pueden usar Azure Automation Update Management (heredado) o Azure Update Manager para la orquestación de parches a escala con evaluación, aprobación, ventanas de mantenimiento y grupos dinámicos. Integre alertas para detectar implementaciones fallidas y generar informes de cumplimiento por suscripción, sistema operativo y gravedad. Para la deriva de configuración (configuration drift), Azure Automation State Configuration (DSC) aplica configuraciones declarativas, monitorea el cumplimiento y corrige las desviaciones. Modele las configuraciones como código, gestiónelas con control de versiones y páselas por las diferentes fases de los entornos.
Integre alertas para activar runbooks en escenarios de autorremediación: escalar horizontalmente por saturación de CPU, reiniciar servicios fallidos tras la pérdida de un heartbeat o poner en cuarentena los recursos no conformes detectados por Policy. Cierre el ciclo con la creación de incidentes a través de conectores ITSM e incluya evidencia previa y posterior a la remediación mediante consultas de Log Analytics integradas en los runbooks.
Escenario de problema práctico
Tailwind Traders opera una plataforma de comercio electrónico multirregional en AKS, App Service y Azure SQL Database a través de seis suscripciones. La dirección exige una disponibilidad del servicio del 99.9 %, informes mensuales de cambios en las implementaciones, una reducción de costos del 20 % mediante compromisos y un cumplimiento auditable de las políticas de etiquetado y de red.
- Establecer telemetría centralizada
- Crear dos áreas de trabajo de Log Analytics (EE. UU., UE) para satisfacer las necesidades de residencia de datos y RBAC. Configurar los ajustes de diagnóstico en las suscripciones, grupos de recursos y todos los recursos críticos para enviar métricas/registros de recursos y el Activity Log al área de trabajo regional. Se eligió porque un modelo regional de dos áreas de trabajo equilibra la soberanía, el rendimiento y el análisis centralizado sin movimiento de datos transfronterizo.
- Instrumentar aplicaciones
- Habilitar Application Insights con autoinstrumentación para App Service y el sidecar de AKS donde sea compatible; usar OpenTelemetry para los servicios escritos en Go. Configurar el muestreo adaptativo y el seguimiento distribuido. Se seleccionó para obtener una visibilidad profunda de las solicitudes, dependencias y excepciones con cambios mínimos en el código y un costo de ingesta controlado.
- Alertas accionables
- Implementar alertas de métricas para síntomas de SLO (latencia p95, tasa de errores 5xx, profundidad de la cola) y alertas de registro para ráfagas de errores y detecciones KQL personalizadas. Enrutarlas a grupos de acciones basados en roles: Operaciones de guardia (PagerDuty + correo electrónico), Automatización SRE (Logic App) y Dirección (resumen por correo electrónico). Esto separa la detección de la respuesta y permite un enrutamiento de incidentes personalizado y fiable.
- Disponibilidad y experiencia de usuario
- Configurar pruebas de disponibilidad multirregionales de Application Insights contra las API de la tienda y de pago con aserciones estrictas de SSL y contenido. Se eligió para detectar problemas externos que afectan al cliente, independientemente de las métricas internas.
- Paneles de control operativos
- Crear Azure Monitor Workbooks con parámetros (suscripción, región, entorno) que combinen métricas, gráficos KQL y enlaces de desglose (drill-through) a trazas y registros. Adoptar la implementación de los JSON de los workbooks como IaC. Los workbooks proporcionan runbooks-en-una-página compartidos e interactivos para el NOC y el SRE.
- Gobernanza de costos
- Establecer presupuestos por suscripción y por etiqueta de departamento con alertas al 50/80/100 % que activen una Logic App para notificar a los propietarios y abrir tiques de ITSM. Usar las vistas amortizadas de Cost Analysis y habilitar las recomendaciones de reservas y planes de ahorro; comprar reservas de 3 años para cargas de trabajo estables de SQL MI y planes de ahorro para computación con picos de uso (bursty compute). Esto logra directamente el objetivo de costos del 20 % con barreras de protección (guardrails) automatizadas.
- Advisor y Service Health
- Revisar Azure Advisor semanalmente; crear elementos en el backlog para el dimensionamiento correcto y la redundancia de zona. Configurar alertas de Service Health para las regiones y los servicios en uso, dirigiéndolas al grupo de acciones del personal de guardia. Esto garantiza la mejora continua y una rápida concienciación sobre los incidentes de la plataforma.
- Cumplimiento e informes de la flota
- Asignar una iniciativa de Azure Policy que exija las etiquetas requeridas, prohíba las IP públicas en las NIC y requiera la configuración de diagnóstico. Usar exenciones para las excepciones aprobadas con fecha de caducidad. Configurar tareas de remediación con una identidad administrada. Usar Azure Resource Graph para consultar el cumplimiento de las políticas y los activos sin etiquetar en todas las suscripciones, y mostrar los resultados en Workbooks para auditoría. Esto crea una gobernanza automatizada y auditable con un cumplimiento medible.
- Informes de cambios en las implementaciones
- Consultar AzureActivity en Log Analytics para las implementaciones de ARM y correlacionarlo con los registros de evaluación de políticas para producir un informe mensual, enviado por correo electrónico a través de una Logic App. Esto aprovecha el Activity Log como la fuente autorizada de los eventos de implementación sin necesidad de agentes personalizados.
- Remediación y aplicación de parches automatizadas
- Usar runbooks de Azure Automation para reiniciar pods en mal estado a través de las API de AKS cuando se disparen las alertas de heartbeat y para rotar los secretos de Key Vault. Habilitar Azure Update Manager para el cumplimiento de parches con ventanas de mantenimiento y grupos dinámicos. Los Hybrid Runbook Workers ejecutan de forma segura las tareas vinculadas a la red. Esto cierra el ciclo desde la detección hasta la resolución y mantiene la flota actualizada.
Cada servicio elegido minimiza el desarrollo personalizado, escala a través de las suscripciones y se alinea con los objetivos de gobernanza, costo y fiabilidad, manteniendo al mismo tiempo una clara propiedad operativa.
← Arquitectura de Integración y Mensajería · Todos los dominios · Migración y Modernización →
Practica estas preguntas → · Práctica cronometrada en ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Aprueba tu examen →