Microsoft AZ-305: Surveillance, optimisation des coûts et opérations — Guide d'étude
Fait partie du Microsoft Azure Solutions Architect Expert AZ-305 — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Microsoft, ou passez des tests chronométrés sur ExamRoll.io.
Vue d’ensemble
Une conception robuste de la surveillance et des opérations Azure établit une structure de télémétrie unique, des alertes exploitables, des coûts maîtrisés et des rapports de conformité à l’échelle du parc. La solution couvre les métriques et les journaux d’Azure Monitor, Log Analytics et Kusto Query Language (KQL), Application Insights pour la télémétrie applicative, et la gouvernance opérationnelle via Azure Policy, Azure Resource Graph et Advisor. Le contrôle des coûts est renforcé par Azure Cost Management, tandis que la fiabilité de la plateforme et la connaissance des changements reposent sur Azure Service Health. Azure Automation boucle la boucle avec la remédiation reproductible et l’orchestration des mises à jour. Les Workbooks unifient les informations de ces services pour une visibilité opérationnelle.
Observabilité avec Azure Monitor, Application Insights et les Workbooks
Azure Monitor collecte la télémétrie sur la plateforme et les charges de travail, en stockant des métriques de séries chronologiques et des données de journaux. Les métriques sont des valeurs légères, quasi temps réel, adaptées au suivi des seuils et des SLO (par ex., CPU, taux d’erreurs HTTP 5xx). Les journaux capturent une télémétrie structurée et interrogeable qui prend en charge la corrélation et l’analyse des causes profondes. Concevez des alertes de métrique pour une détection rapide des symptômes et des alertes de journal pour une détection plus riche, basée sur des conditions, à l’aide de KQL.
Les groupes d’actions découplent la détection de la réponse. Associez des e-mails/SMS/appels vocaux, des notifications push, des webhooks sécurisés, des connecteurs ITSM, des Azure Functions, des Logic Apps et des runbooks Azure Automation. Utilisez des groupes d’actions distincts pour la production et la non-production, et appliquez des calendriers de suppression pendant la maintenance planifiée. Acheminez les alertes vers la gestion des incidents avec des charges utiles cohérentes et incluez le contexte de la ressource ainsi que des liens vers des runbooks.
Les paramètres de diagnostic sont obligatoires pour obtenir une visibilité complète. Activez-les au niveau de la ressource, du groupe de ressources et de l’abonnement pour exporter les métriques et les journaux de ressources (par ex., Activity, Administrative, Policy, Security, NetworkSecurityGroupFlowEvent) vers Log Analytics pour l’interrogation, vers le stockage pour la rétention à froid, et vers Event Hubs pour le streaming vers des SIEM. Configurez toujours un paramètre de diagnostic au niveau de l’abonnement sur le journal d’activité afin de pouvoir créer des rapports sur les déploiements et les évaluations de stratégies, et générer des rapports de changements mensuels.
Application Insights ajoute une observabilité applicative approfondie. Instrumentez avec le SDK ou OpenTelemetry pour le suivi distribué, les dépendances, les requêtes, les exceptions et les événements personnalisés. Utilisez l’instrumentation automatique sur App Services, Functions, AKS et les VM/VMSS via l’agent Azure Monitor là où il est pris en charge pour minimiser les modifications de code. Les tests de disponibilité simulent le trafic utilisateur depuis plusieurs régions ; configurez la fréquence, les emplacements de test, les vérifications SSL/HTTP et les critères de réussite. La détection intelligente (Smart Detection) utilise des analyses intégrées pour signaler des modèles d’anomalies tels que des pics de défaillance soudains et une dégradation des performances. L’échantillonnage contrôle l’ingestion et les coûts tout en préservant la fidélité statistique ; appliquez l’échantillonnage adaptatif pour le trafic dynamique ou l’échantillonnage à taux fixe pour une analyse déterministe, et excluez les transactions critiques de l’échantillonnage lorsque la conformité exige une capture complète.
Les Workbooks Azure Monitor fournissent des tableaux de bord interactifs et paramétrés qui unissent les métriques, les journaux et les signaux de coût en un seul artefact. Utilisez des paramètres pour l’abonnement, la région, l’environnement et l’intervalle de temps afin de permettre la réutilisation entre les zones d’atterrissage. Combinez des visualisations avec du texte narratif pour standardiser les playbooks opérationnels et les runbooks sur une seule page. Stockez les workbooks dans des groupes de ressources, appliquez le RBAC pour un accès contrôlé, et créez des modèles JSON pour les déploiements en infrastructure-as-code.
Log Analytics et KQL à grande échelle
Un espace de travail Log Analytics est le point d’agrégation central pour les journaux Azure Monitor. Choisissez un espace de travail régional et centralisé selon les exigences de résidence des données, ou une conception fédérée avec un espace par zone d’atterrissage lorsqu’une souveraineté stricte des données ou une segmentation RBAC est nécessaire. Pour les grandes entreprises, privilégiez un hub (espace de travail partagé) complété par des espaces de travail spoke sélectifs pour les domaines sensibles ou à fort volume. Alignez les plans de table sur la valeur des données : utilisez les tables Analytics pour les données de sécurité et d’opérations à haute valeur ; les journaux de base (Basic Logs) pour les journaux verbeux de faible valeur avec un accès en recherche seule ; et l’archivage (Archive) pour une rétention à long terme et à faible coût avec récupération via des tâches de recherche (Search Jobs).
Les règles de collecte de données (DCR) définissent ce que l’agent Azure Monitor (AMA) collecte, y compris les journaux syslog/d’événements, les compteurs de performance, les canaux d’événements Windows et les journaux texte personnalisés. Utilisez des DCR distinctes par type de système d’exploitation et par rôle, et gérez la portée via les VMSS, les groupes de machines virtuelles identiques (scalesets) et Azure Arc pour l’hybride. Préférez les tables personnalisées basées sur les DCR aux anciennes API d’ingestion pour la gouvernance et la cohérence.
La rétention doit équilibrer les fenêtres d’investigation avec les coûts. Appliquez une rétention par table pour les données chaudes utilisées dans les opérations quotidiennes (par ex., 30 à 90 jours) et archivez les données à longue traîne (par ex., 6 à 24 mois) pour la conformité et la chasse aux menaces (threat hunting). Surveillez le volume d’ingestion, les tables les plus volumineuses (« noisy »), et appliquez l’échantillonnage ou le filtrage au niveau des DCR pour éviter de collecter des journaux redondants. Utilisez les niveaux d’engagement pour optimiser les coûts d’ingestion lorsqu’ils sont prévisibles.
KQL est le langage commun opérationnel. Maîtrisez les filtres (where), les transformations (extend, project), le regroupement temporel (bin/1m), les agrégations (summarize by), les jointures (inner/leftouter) et le rendu (render timechart). Créez des requêtes planifiées pour les alertes de journal avec des contrôles de limitation (throttling), des dimensions de répartition (split-by) pour les alertes à haute cardinalité, et des seuils dynamiques pour les alertes basées sur des lignes de base. Les vues matérialisées et l’optimisation des performances des requêtes (par ex., projeter tôt les colonnes inutilisées, réduire la fenêtre de temps) garantissent une interrogation rentable. Pour les rapports de déploiement ARM, interrogez AzureActivity ou l’historique des modifications d’Azure Resource Graph exporté dans Log Analytics et corrélez-le avec les événements de stratégie (Policy) pour l’analyse de la gouvernance.
Coûts, Intégrité, Advisor, Resource Graph et Conformité des stratégies
Azure Cost Management permet une gouvernance proactive. Les budgets définis au niveau des abonnements, des groupes de ressources ou des groupes d’administration déclenchent des alertes à des seuils cumulatifs (par ex., 50 %, 80 %, 100 %). Associez les alertes de budget à des groupes d’actions pour exécuter des Logic Apps ou des Functions qui étiquettent, réduisent la taille ou même mettent en quarantaine les ressources non critiques. Utilisez l’Analyse des coûts pour créer des vues amorties, regrouper par étiquette (centre de coûts, propriétaire) et identifier les anomalies par service ou par région. Les recommandations de réservations et de plans d’économies mettent en évidence les opportunités d’engagement pour les machines virtuelles, SQL, Cosmos DB, et plus encore. Évaluez l’étendue de l’achat (abonnement unique ou partagé), la durée (1 ou 3 ans) et la correspondance de la couverture (flexibilité de la taille d’instance, Azure Hybrid Benefit).
Azure Advisor évalue en continu les abonnements et les ressources, produisant des recommandations hiérarchisées concernant les coûts (ajustement de la taille, ressources inactives, réservations), la sécurité (via Defender for Cloud), la fiabilité (redondance de zone, posture de sauvegarde/restauration), la performance (mise à l’échelle, conseils sur les références SKU) et l’excellence opérationnelle (hygiène des étiquettes, adoption des stratégies). Suivez le score Advisor pour quantifier la posture et alimenter les backlogs d’ingénierie.
Azure Service Health opérationnalise la connaissance de la plateforme. Les problèmes de service capturent les incidents en direct ; la maintenance planifiée communique les changements à venir sur la plateforme ; les avis d’intégrité incluent les dépréciations et les meilleures pratiques. Configurez des alertes d’intégrité du service avec des groupes d’actions, en filtrant par abonnement, région et service. Associez Service Health à Resource Health pour distinguer les défaillances de la plateforme des problèmes de charge de travail afin d’effectuer un tri précis des incidents.
Azure Resource Graph fournit un inventaire et des analyses de conformité à l’échelle du locataire avec des requêtes à faible latence et à grande échelle utilisant une syntaxe de type KQL. Exécutez des requêtes sur des milliers d’abonnements pour énumérer la dérive des ressources, les actifs non étiquetés, les configurations non sécurisées ou les références SKU non prises en charge. Joignez les résultats de Resource Graph aux ressources de conformité des stratégies pour produire des cumuls au niveau du groupe d’administration, y compris les exceptions et la dernière heure d’évaluation. Utilisez le suivi des modifications (lorsqu’il est disponible) pour capturer les deltas de propriétés à des fins d’analyse forensique.
Azure Policy applique des garde-fous et mesure la conformité. Attribuez des stratégies et des initiatives au niveau des groupes d’administration, des abonnements ou des groupes de ressources. Comprenez les états de conformité : conforme, non conforme, conflit, erreur et exempté. Utilisez les exemptions avec une justification et une date d’expiration pour modéliser l’acceptation des risques sans fausser les métriques de conformité, et n’excluez que l’étendue minimale nécessaire. Pour les effets deployIfNotExists et modify, configurez des tâches de correction s’appuyant sur une identité managée avec des autorisations de moindre privilège. Surveillez l’état des tâches de correction, les échecs et les opérations dans le tableau de bord de conformité et le journal d’activité ; définissez des alertes en cas de non-conformité persistante. Combinez les évaluations de Policy avec Resource Graph et les Workbooks pour créer des tableaux de bord de gouvernance de haut niveau.
Automatisation et gestion des correctifs
Azure Automation orchestre les tâches répétitives. Créez des runbooks en PowerShell ou Python, déclenchés par des planifications, des webhooks, des déclencheurs basés sur des événements ou des alertes. Utilisez les Hybrid Runbook Workers pour exécuter l’automatisation à proximité des ressources dans des réseaux privés ou d’autres clouds, sous la gouvernance d’Azure Arc. Mettez en œuvre des modules standardisés et une gestion des erreurs, et stockez les secrets dans Key Vault.
La gestion des mises à jour (Update Management) garantit que les systèmes d’exploitation sont à jour. Les organisations peuvent utiliser Azure Automation Update Management (hérité) ou Azure Update Manager pour l’orchestration des correctifs à grande échelle, avec évaluation, approbation, fenêtres de maintenance et groupes dynamiques. Intégrez des alertes pour intercepter les déploiements échoués et générer des rapports de conformité par abonnement, système d’exploitation et gravité. Pour la dérive de configuration, Azure Automation State Configuration (DSC) applique des configurations déclaratives, suit la conformité et corrige les écarts. Modélisez les configurations en tant que code (as code), versionnez-les et déployez-les progressivement à travers les environnements.
Intégrez des alertes pour déclencher des runbooks pour des scénarios d’auto-remédiation : effectuer un scale-out en cas de saturation du CPU, redémarrer les services défaillants en cas de perte de signal de pulsation (heartbeat), ou mettre en quarantaine les ressources non conformes détectées par Policy. Bouclez la boucle avec la création d’incidents via des connecteurs ITSM et incluez des preuves avant et après la remédiation grâce à des requêtes Log Analytics intégrées dans les runbooks.
Scénario de problème pratique
Tailwind Traders exploite une plateforme de e-commerce multi-régions sur AKS, App Service et Azure SQL Database, répartie sur six abonnements. La direction exige une disponibilité de service de 99,9 %, un rapport mensuel sur les changements de déploiement, une réduction des coûts de 20 % via des engagements, et une conformité vérifiable avec les politiques de balisage (tagging) et de réseau.
- Établir une télémétrie centralisée
- Créez deux espaces de travail Log Analytics (US, EU) pour satisfaire les besoins de résidence des données et de RBAC. Configurez les paramètres de diagnostic sur les abonnements, les groupes de ressources et toutes les ressources critiques pour envoyer les métriques/journaux de ressources et le journal d’activité (Activity Log) à l’espace de travail régional. Ce choix a été fait car un modèle régional à double espace de travail équilibre la souveraineté, la performance et l’analyse centralisée sans mouvement de données transfrontalier.
- Instrumenter les applications
- Activez Application Insights avec l’auto-instrumentation pour App Service et en sidecar pour AKS là où c’est pris en charge ; utilisez OpenTelemetry pour les services écrits en Go. Configurez l’échantillonnage adaptatif et le suivi distribué. Ce choix a été fait pour obtenir une visibilité approfondie des requêtes, des dépendances et des exceptions avec des modifications de code minimales et un coût d’ingestion maîtrisé.
- Mettre en place des alertes exploitables
- Mettez en œuvre des alertes de métriques pour les symptômes de SLO (latence p95, taux d’erreurs 5xx, profondeur de la file d’attente) et des alertes de journal pour les pics d’erreurs et les détections KQL personnalisées. Acheminez-les vers des groupes d’actions basés sur les rôles : Équipe d’astreinte (Ops On-Call via PagerDuty + e-mail), Automatisation SRE (Logic App) et Direction (résumé par e-mail). Cela sépare la détection de la réponse et permet un acheminement des incidents personnalisé et fiable.
- Disponibilité et expérience utilisateur
- Configurez des tests de disponibilité multi-régions Application Insights sur la vitrine (storefront) et les API de paiement (checkout) avec des assertions strictes sur le SSL et le contenu. Ce choix a été fait pour détecter les problèmes externes impactant les clients, indépendamment des métriques internes.
- Tableaux de bord opérationnels
- Créez des Azure Monitor Workbooks avec des paramètres (abonnement, région, environnement) combinant des métriques, des graphiques KQL et des liens d’exploration (drill-through) vers les traces et les journaux. Adoptez le déploiement IaC du JSON des workbooks. Les Workbooks fournissent des manuels opérationnels interactifs et partagés (runbooks-on-a-page) pour le NOC et les SRE.
- Gouvernance des coûts
- Définissez des budgets par abonnement et par balise de département avec des alertes à 50/80/100 % qui déclenchent une Logic App pour notifier les propriétaires et ouvrir des tickets ITSM. Utilisez les vues amorties de l’Analyse des coûts (Cost Analysis) et activez les recommandations de réservations et de plans d’économies ; achetez des réservations de 3 ans pour les charges de travail SQL MI stables et des plans d’économies pour le calcul en rafale (bursty compute). Cela permet d’atteindre directement l’objectif de réduction des coûts de 20 % avec des garde-fous automatisés.
- Advisor et Service Health
- Examinez Azure Advisor chaque semaine ; créez des éléments de backlog pour le redimensionnement (right-sizing) et la redondance de zone. Configurez des alertes Service Health pour les régions et les services utilisés, dirigées vers le groupe d’actions de l’équipe d’astreinte. Celles-ci garantissent une amélioration continue et une prise de conscience rapide des incidents de la plateforme.
- Conformité et rapports sur le parc
- Attribuez une initiative Azure Policy qui impose les balises requises, interdit les adresses IP publiques sur les cartes réseau (NIC) et exige les paramètres de diagnostic. Utilisez des exemptions pour les exceptions approuvées avec une date d’expiration. Configurez des tâches de remédiation avec une identité managée. Utilisez Azure Resource Graph pour interroger la conformité des politiques et les ressources non balisées sur tous les abonnements, et présentez les résultats dans des Workbooks pour l’audit. Cela crée une gouvernance automatisée et vérifiable avec une conformité mesurable.
- Rapport sur les changements de déploiement
- Interrogez AzureActivity dans Log Analytics pour les déploiements ARM et corrélez avec les journaux d’évaluation des politiques pour produire un rapport mensuel, envoyé par e-mail via une Logic App. Cela exploite le journal d’activité (Activity Log) comme source faisant autorité pour les événements de déploiement, sans agents personnalisés.
- Remédiation automatisée et gestion des correctifs
- Utilisez des runbooks Azure Automation pour redémarrer les pods défectueux via les API AKS lorsque des alertes de signal de pulsation (heartbeat) se déclenchent, et pour effectuer la rotation des secrets depuis Key Vault. Activez Azure Update Manager pour la conformité des correctifs avec des fenêtres de maintenance et des groupes dynamiques. Les Hybrid Runbook Workers exécutent de manière sécurisée les tâches liées au réseau. Cela boucle la boucle de la détection à la résolution et maintient le parc à jour.
Chaque service choisi minimise le développement personnalisé, s’adapte à plusieurs abonnements et s’aligne sur les objectifs de gouvernance, de coût et de fiabilité tout en maintenant une responsabilité opérationnelle claire.
← Architecture d’intégration et de messagerie · Tous les domaines · Migration et modernisation →
Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Réussissez votre examen →