Microsoft AZ-104: Azure Monitor、备份和站点恢复 — 学习指南

属于 Microsoft Azure Administrator Associate AZ-104 — 学习指南. 使用经过验证的答案练习: Microsoft 考试中心, 或参加限时模拟考试: ExamRoll.io.

概述

Azure 上的卓越运营需要三大支柱协同工作:可观测的遥测数据、可恢复的数据和弹性的连续性计划。Azure Monitor 及其 Log Analytics 基础可收集高保真指标和日志,驱动智能警报,并呈现应用程序性能。Azure Backup 通过策略驱动、基于保管库的恢复来保护平台和 IaaS 数据,其中包括可实现最短停机时间的即时还原功能。Azure Site Recovery (ASR) 将工作负载复制到备用站点,并编排故障转移和故障恢复,以满足业务的 RPO/RTO 要求。补充性服务——用于网络诊断的 Network Watcher 和用于平台感知的 Azure Service Health——共同构成了一套完整的管理员工具包。

Azure Monitor and Log Analytics

Azure Monitor 统一了平台指标和日志。指标是为近实时分析而优化的数字时间序列(高基数、多维度,对大多数资源而言具有一分钟的粒度)。使用 Metrics Explorer 进行可视化,并通过静态或动态阈值设置近实时指标警报。日志是存储在 Log Analytics 工作区中的富架构记录,可使用 Kusto 查询语言 (KQL) 进行查询,用于调查、仪表板和计划(日志)警报。

诊断设置是连接资源与遥测接收器的桥梁。在每个 Azure 资源上,配置诊断设置以选择类别(平台指标、平台日志和资源日志),并将其路由到一个或多个目标:

审慎设计 Log Analytics 工作区:

精通 KQL 至关重要。示例:

undefined

undefined

undefined

操作组定义了响应警报的人员和方式:电子邮件/短信/推送/语音、安全 Webhook、ITSM 连接器、Functions、Logic Apps 和 Automation runbook。在多个警报规则中重用操作组,并强制执行一致的事件路由。

Azure Monitor 支持多种警报类型:

Application Insights and Alerting

Application Insights 通过检测代码和平台来提供端到端的应用程序遥测。使用连接字符串和一流的 SDK(.NET、Java、Node.js、Python)或 OpenTelemetry 进行供应商中立的跟踪。对于 PaaS 服务(App Service、Functions、AKS),在可用时启用自动检测,以在无需更改代码的情况下捕获请求、依赖项、异常和跟踪。维护分布式跟踪上下文,以关联客户端、API 和后端跃点。

关键遥测类型:

应用自适应采样来控制引入量而又不失信号保真度,并在事件期间使用 Live Metrics Stream 获取低延迟的洞察。

可用性测试验证外部可达性和 SLA:

通过 Application Insights 中的智能检测来增强警报功能:

Azure Backup

恢复服务保管库是备份管理、策略和恢复的核心。应将保管库放置在与受保护资源相同的区域中(或者,对于服务支持的跨区域还原场景,则放置在配对区域中)。通过软删除、清除保护和针对关键操作的多用户授权来强化保管库的安全性。

备份策略定义了计划和保留期:

即时还原功能通过使用本地存储的快照来加速 VM 恢复,这些快照在存入保管库的深层存储之前会短期保留。管理员可以:

VM 备份的注意事项包括针对非关键数据的磁盘排除、加密处理(Azure Backup 支持加密磁盘)以及一致性模型(崩溃一致性与应用程序一致性)。Azure Files 备份利用存储快照,受益于增量、空间高效的保留策略和软删除保护。Azure VM 中的 SQL 备份使用一个由保管库协调的、感知工作负载的扩展,以在 Always On 可用性组和独立实例中生成合规、可还原的备份链。

Azure Site Recovery、Network Watcher 和 Service Health

ASR 提供工作负载复制和编排式恢复:

RPO/RTO 目标指导策略制定:

Azure Network Watcher 为管理员提供精确的网络诊断工具:

Azure Service Health 通过平台感知能力来补充监控:

实际问题场景

Adobe 必须加固并投入运营一个新的双区域 Azure 电子商务平台,满足严格的可观测性、备份和灾难恢复目标,同时确保快速的网络故障排除和平台感知能力。

  1. 每个区域部署一个中央 Log Analytics 工作区,并将数据收集规则 (DCR) 附加到所有 VM 和 AKS 节点,以通过诊断设置收集性能、syslog/EventLog 和特定于资源的日志。 原因:区域性工作区可保护数据驻留和性能;AMA+DCR 提供精细、可扩展的收集和成本控制。

  2. 在 App Service、Key Vault、Azure Firewall、Application Gateway 和 Storage 上配置诊断设置,将日志和指标路由到区域工作区,并路由到存储帐户以进行长期保留。 原因:集中式分析可实现跨资源关联分析;存储保留满足合规性和取证需求。

  3. 使用 OpenTelemetry 检测 Web 和 API 层,并在 App Service 上启用自动检测。从至少五个 Azure 区域创建可用性测试,并进行内容匹配和 TLS 到期检查。 原因:深度分布式追踪和综合测试能在客户发现问题之前,检测到影响用户的回归。

  4. 创建 Azure Monitor 警报:

  1. 使用 Azure Backup 保护数据:
  1. 为 Web、API 和 SQL 层实施 Azure Site Recovery 以实现区域到区域的灾难恢复 (DR),复制策略的目标是低 RPO 和每小时的应用一致性恢复点。构建一个分层(首先是数据层,然后是 API 层,最后是 Web 层)的恢复计划,包含更新 DNS 和清除 CDN 缓存的自动化,并每季度在隔离的 VNet 上进行测试故障转移。 原因:ASR 复制和恢复计划通过编排式、可审计的 runbook 和无中断测试,提供可预测的 RTO。

  2. 启用 Network Watcher,并使用“连接故障排除”来验证前端到后端的流,使用“下一跃点”来验证通过 NVA 层的 UDR,使用“IP 流验证”来确认 NSG 加固。在 API VM 上配置按需数据包捕获,用于间歇性超时分析。 原因:专用诊断工具可快速隔离路由/NSG 问题,并在需要时提供数据包级别的证据。

  3. 为范围内的两个区域和服务(App Service、SQL、Storage、Key Vault、Front Door)创建 Azure Service Health 警报。将警报路由到相同的操作组,并为计划内维护建议添加领导层通讯组列表。 原因:主动感知平台事件和维护可防止意外中断,并实现协调沟通。

这种集成方法确保 Adobe 能够满足其 RPO/RTO 目标,从勒索软件或操作员错误中快速恢复,在几分钟内检测和修复异常,并能够最终确定地对网络路径进行故障排除,同时随时了解 Azure 平台事件。


Azure 数据库和数据服务 · 所有领域 · Azure 安全和合规性

练习这些题目 → · 在 ExamRoll.io 上限时练习 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

通过考试 →

浏览 Microsoft →

Related guides

一体化访问

一次订阅。所有考试。

所有计划均可无限制搜索答案、进行模拟测试、获取AI解释以及访问完整的资源库 — 支持20多种语言。

每月
24.87
Just €0.83/day
包含所有内容:
  • 无限答案搜索
  • 无限模拟测试
  • AI驱动的解释
  • 完整资源库
  • 20多种语言
  • 每周内容更新
  • 奖励与推荐
  • 优先支持
开始免费试用

无需信用卡*

最具价值
12个月
179.87
Just €0.49/daySave 40%
包含所有内容:
  • 无限答案搜索
  • 无限模拟测试
  • AI驱动的解释
  • 完整资源库
  • 20多种语言
  • 每周内容更新
  • 奖励与推荐
  • 优先支持
开始免费试用

无需信用卡*

✓ 包含免费计划 · ✓ 随时取消 · ✓ 所有计划均解锁完整产品