Microsoft AZ-305: 监控、成本优化与运维 — 学习指南
属于 Microsoft Azure Solutions Architect Expert AZ-305 — 学习指南. 使用经过验证的答案练习: Microsoft 考试中心, 或参加限时模拟考试: ExamRoll.io.
概述
一个稳健的 Azure 监控与运营设计需要建立统一的遥测体系、可操作的警报、受治理的成本以及覆盖整个资源群的合规性报告。该解决方案涵盖 Azure Monitor 的指标和日志、Log Analytics 和 Kusto 查询语言 (KQL)、用于应用程序遥测的 Application Insights,以及通过 Azure Policy、Azure Resource Graph 和 Advisor 实现的运营治理。成本控制通过 Azure Cost Management 加以强化,而平台可靠性和变更感知则依赖于 Azure Service Health。Azure Automation 通过可重复的修复和更新编排来形成闭环。Workbooks 统一了这些服务的洞察,以实现运营可见性。
使用 Azure Monitor、Application Insights 和 Workbooks 实现可观测性
Azure Monitor 收集跨平台和工作负载的遥测数据,存储时间序列指标和日志数据。指标是轻量级的近实时值,适用于阈值设定和 SLO 跟踪(例如 CPU、HTTP 5xx 错误率)。日志捕获结构化的、可查询的遥测数据,支持关联分析和根本原因分析。设计指标警报以实现快速症状检测,并使用 KQL 设计日志警报以实现更丰富的、基于条件的检测。
操作组将检测与响应解耦。关联电子邮件/短信/语音、推送通知、安全 webhook、ITSM 连接器、Azure Functions、Logic Apps 和 Automation runbook。为生产环境和非生产环境使用不同的操作组,并在计划内维护期间应用抑制计划。将警报路由到事件管理系统,使用一致的负载,并包含资源上下文和 runbook 链接。
诊断设置是实现完全可见性的强制要求。在资源、资源组和订阅范围启用诊断设置,以将指标和资源日志(例如 Activity、Administrative、Policy、Security、NetworkSecurityGroupFlowEvent)导出到 Log Analytics 进行查询,导出到存储账户进行冷保留,以及导出到 Event Hubs 以流式传输到 SIEM 系统。务必在 Activity Log 上配置订阅级别的诊断设置,以便您可以报告部署和策略评估情况,并生成月度变更报告。
Application Insights 增加了深度的应用程序可观测性。使用 SDK 或 OpenTelemetry 进行插桩,以实现分布式跟踪、依赖项、请求、异常和自定义事件的监控。在支持的情况下,通过 Azure Monitor agent 对 App Services、Functions、AKS 和 VM/VMSS 使用自动插桩,以最大限度地减少代码更改。可用性测试从多个区域模拟用户流量;配置频率、测试位置、SSL/HTTP 检查和成功标准。Smart Detection 使用内置分析来标记异常模式,例如突发的故障峰值和性能下降。采样在保持统计保真度的同时控制数据引入量和成本;对动态流量应用自适应采样,或对确定性分析应用固定速率采样,并在合规性要求完全捕获的情况下将关键事务从采样中排除。
Azure Monitor Workbooks 提供交互式的、参数化的仪表板,将指标、日志和成本信号统一在一个工件中。使用订阅、区域、环境和时间范围等参数,以实现在不同登陆区域之间的可重用性。将可视化与叙述性文本相结合,以标准化运营操作手册和单页式 runbook。将 workbooks 存储在资源组中,应用 RBAC 进行访问控制,并为基础架构即代码 (IaC) 部署将 JSON 模板化。
大规模使用 Log Analytics 和 KQL
Log Analytics 工作区是 Azure Monitor Logs 的中央聚合点。根据数据驻留要求选择一个区域性的集中式工作区,或者在需要严格的数据主权或 RBAC 分段时,采用每个登陆区域一个工作区的联合设计。对于大型企业,推荐采用一个中心(共享工作区)加上为敏感或高流量领域设置的选定分支工作区的模式。根据数据价值调整表计划:对高价值的安全和运营数据使用 Analytics 表;对详细但价值较低、仅需搜索访问的日志使用 Basic Logs;对需要长期、低成本保留的数据使用 Archive,并通过 Search Jobs 进行检索。
数据收集规则 (DCR) 定义了 Azure Monitor Agent (AMA) 收集的内容,包括 syslog/事件日志、性能计数器、Windows 事件通道和自定义文本日志。为每种 OS 类型和角色使用不同的 DCR,并通过 VMSS、规模集和用于混合云的 Azure Arc 来管理范围。为了治理和一致性,应优先使用基于 DCR 的自定义表,而不是旧版的引入 API。
数据保留策略必须在调查窗口期与成本之间取得平衡。对日常运营中使用的热数据应用按表设置的保留期(例如 30-90 天),并将长尾数据存档(例如 6-24 个月)以满足合规性和威胁搜寻的需求。监控引入量、噪声最大的表,并在 DCR 层面应用采样或筛选,以避免收集冗余日志。当引入量可预测时,使用承诺层级来优化引入成本。
KQL 是运营领域的通用语言。掌握筛选器 (where)、转换 (extend, project)、时间分箱 (bin/1m)、聚合 (summarize by)、联接 (inner/leftouter) 和渲染 (render timechart)。为日志警报构建带有节流控制的计划查询,为高基数警报使用 split-by 维度,并为基线化警报使用动态阈值。物化视图和查询性能调优(例如,尽早使用 project-away 剔除不用的列、缩小时间窗口)可确保查询的成本效益。对于 ARM 部署报告,查询 AzureActivity 或导出到 Log Analytics 的 Azure Resource Graph 变更历史,并与 Policy 事件相关联以进行治理分析。
成本、运行状况、顾问、资源图和策略合规性
Azure Cost Management 可实现主动治理。将预算范围限定于订阅、资源组或管理组,可在达到累积阈值(例如 50%、80%、100%)时触发警报。将预算警报链接到操作组,以运行 Logic Apps 或 Functions 来标记、缩减甚至隔离非关键资源。使用成本分析来构建摊销视图,按标签(成本中心、所有者)分组,并按服务或区域识别异常。预留和节省计划建议会揭示 VM、SQL、Cosmos DB 等服务的承诺购买机会。评估购买范围(单个订阅或共享)、期限(1 年或 3 年)和覆盖范围匹配(实例大小灵活性、Azure 混合权益)。
Azure Advisor 持续评估订阅和资源,生成跨成本(规模优化、空闲资源、预留)、安全性(通过 Defender for Cloud)、可靠性(区域冗余、备份/恢复状况)、性能(缩放、SKU 指导)和卓越运营(标签规范、策略采用)的优先建议。跟踪 Advisor 分数以量化当前状况并推动工程积压工作。
Azure Service Health 将平台感知操作化。服务问题捕获实时事件;计划内维护传达即将发生的平台变更;运行状况通告包含弃用信息和最佳实践。通过筛选订阅、区域和服务,配置带有操作组的服务运行状况警报。将 Service Health 与 Resource Health 结合使用,以区分平台故障和工作负载问题,从而进行准确的事件分类。
Azure Resource Graph 使用类似 KQL 的语法,通过低延迟、大规模的查询提供租户范围的清单和合规性分析。跨数千个订阅进行查询,以枚举资源漂移、未标记资产、不安全的配置或不受支持的 SKU。将 Resource Graph 结果与策略合规性资源联接,以生成管理组汇总报告,包括例外情况和上次评估时间。使用变更跟踪(如果可用)来捕获属性增量以进行取证分析。
Azure Policy 强制实施护栏并衡量合规性。在管理组、订阅或资源组范围分配策略和计划。理解合规性状态:合规、不合规、冲突、错误和豁免。使用具有理由和到期时间的豁免来对风险接受进行建模,而不会扭曲合规性指标,并且仅排除必要的最小范围。对于 deployIfNotExists 和 modify 效果,请配置由具有最低权限的托管标识支持的修复任务。在合规性仪表板和 Activity Log 中监视修复作业的状态、失败和操作;针对持续不合规设置警报。将策略评估与 Resource Graph 和 Workbooks 相结合,以呈现面向高管的治理仪表板。
练习这些题目 → · 在 ExamRoll.io 上限时练习 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
通过考试 →