Microsoft AZ-500: 事件响应、恢复和弹性 — 学习指南
属于 Microsoft Azure Security Engineer Associate AZ-500 — 学习指南. 使用经过验证的答案练习: Microsoft 考试中心, 或参加限时模拟考试: ExamRoll.io.
概述
Azure 中的事件响应、恢复和弹性是一项持续的能力,它将经过充分演练的操作流程与平台原生控件融为一体。一个有效的方案能够预测故障或泄露,快速检测和分类,通过自动化控制爆炸半径,将服务恢复至既定目标,保存不可变证据,然后根据经验教训强化环境。Azure 原生服务——Microsoft Sentinel、Defender for Cloud、Logic Apps、Azure Backup、Azure Site Recovery (ASR)、DDoS Protection、Web Application Firewall (WAF)、Traffic Manager/Front Door 和 Microsoft Entra——提供了构建模块。其设计要点是预先部署正确的遥测数据、身份紧急访问路径和自动化强制措施,以便团队能够在几分钟内(而不是几小时内)执行操作。
事件响应生命周期和 Sentinel 操作
准备
- 定义谁在何时使用何种工具执行何种操作。预先配置 Microsoft Sentinel 工作区,连接数据源(活动日志、资源日志、NSG 流日志、Microsoft Entra 登录/审核日志、Defender 信号),并为分析师、响应者和事件指挥官实施访问控制和 RBAC。
- 为常见的遏制操作(如虚拟机隔离、用户令牌吊销或密钥轮换)创建剧本 (Logic Apps)。预先部署隔离 NSG 和专用的“取证”订阅。
- 通过诊断设置将日志保留到 Log Analytics 和具有不可变性 (WORM) 的 Azure 存储账户,以建立不可变的日志保留机制。
检测
- 在 Sentinel 中,为凭据盗窃、罕见登录模式、可疑进程执行、密钥保管库滥用和数据泄露启用分析规则。使用 UEBA 和融合规则进行增强,将良性事件关联成有意义的事件。校准规则阈值和抑制措施,以最大程度地减少警报疲劳。
遏制
- 执行预先批准的操作:通过 NSG 隔离 NIC、禁用受损的服务主体、吊销 Entra 刷新令牌、轮换机密、禁用入站公共终结点,或将 WAF 置于预防模式。使用 Sentinel 自动化规则按严重性路由、添加标签、分配所有者并触发剧本。
根除
- 移除持久化机制(启动任务、计划作业、cloud-init 脚本、恶意扩展)、轮换凭据、重新部署黄金镜像,并修补 Defender for Cloud 标记的漏洞。对于与身份相关的事件,要求重置密码并加强条件访问。
恢复
- 从 Azure Backup 恢复到干净的 VNet;使用 ASR 恢复计划进行故障转移;验证完整性并从已知良好的来源(IaC 模板、启用了软删除/清除保护的 Key Vault)恢复机密和配置。确保满足 RTO 和 RPO。
经验教训
- 进行无指责复盘。更新 Sentinel 规则和剧本、Azure Policy 分配、基线镜像和运行手册。在 IaC 中将修复措施代码化,并通过管理组强制执行。
Sentinel 事件分类、证据收集、调查和案例管理
分类
- 使用实体扩充(主机、用户、IP)和监视列表,根据严重性、资产关键性和爆炸半径确定事件的优先级。使用事件分组减少重复项,并使用时间线视图了解事件顺序。
证据收集
- 为值得注意的事件添加书签,将原始日志导出到不可变存储,对受影响的虚拟机磁盘进行快照以供离线分析,并通过 Defender for Endpoint 集成捕获进程树。通过存储哈希值并将访问权限限制在取证资源组内来保护监管链。
调查
- 使用调查图和实体页面(用户登录历史、主机进程树)。使用 KQL 在 SigninLogs、AuditLogs、SecurityEvent 和 AzureDiagnostics 中进行搜寻。记录发现、附加工件并标记 IOC(失陷指标)以供未来检测。
案例管理
- 标准化状态(新建、活动、处理中、已解决)、所有者和 SLA 计时器。将 Sentinel 与 ITSM (ServiceNow/Azure DevOps) 集成,以进行工单和变更控制。自动化规则可以自动关闭已知的良性警报,或将特定策略升级到二线团队。
自动化遏制和工作流编排
Sentinel 自动化规则
- 在事件创建/更新时触发。动态分配所有者、设置严重性、添加标签(例如,QuarantineCandidate),并调用一个或多个剧本。理由:在几秒钟内从检测转向行动,符合最小权限原则和预先批准的剧本。
Logic Apps 剧本
- 常见操作:将隔离 NSG 应用于虚拟机 NIC、禁用用户、吊销令牌、在 WAF 中阻止 IP,或打开一个包含完整上下文的 ITSM 工单。使用托管标识和 Azure RBAC 来限定每个剧本对其确切资源集的权限范围。
Defender for Cloud 工作流自动化
- 针对建议或警报(例如,“向互联网开放 RDP”),自动触发剧本来进行修复(收紧 NSG 规则)、标记资源以供跟进,或通知所有者。理由:快速消除暴露面,提高安全分数并缩短攻击者驻留时间。
示例:在几秒钟内隔离虚拟机 NIC
# Create a high-priority deny-all inbound NSG rule and associate a quarantine NSG to the NIC
az network nsg rule create -g rg-prod -n QuarantineDenyAll --nsg-name nsg-quarantine \
--priority 100 --access Deny --direction Inbound --protocol '*' --source-address-prefixes '*' \
--source-port-ranges '*' --destination-address-prefixes '*' --destination-port-ranges '*'
az network nic update -g rg-prod -n vm1-nic --network-security-group nsg-quarantine
为受损用户吊销令牌
az rest --method POST \
--uri "https://graph.microsoft.com/v1.0/users/user@contoso.com/revokeSignInSessions"
备份、复制、RTO/RPO 和弹性
Azure Backup 安全性
Recovery Services 保管库和 Backup 保管库
- 按工作负载边界和区域使用保管库。启用软删除以防止意外/恶意删除备份项;设置符合法规要求的适当保留期。启用清除保护(在支持的情况下)以防止不可逆的删除。
不可变性
- 配置保管库的不可变性。在初始调优期间使用解锁模式,然后切换到锁定模式,以防止缩短保留期或篡改策略。理由:确保备份一次写入且防篡改,是关键的反勒索软件控制措施。
多用户授权 (MUA)
- 使用位于不同团队拥有的独立订阅/资源组中的 Azure Backup Resource Guard 来保护关键备份操作(例如,停止保护并删除数据、更改保管库设置)。理由:强制实施职责分离;攻击者必须在不同范围内攻破两个身份才能破坏可恢复性。
跨区域功能
- 对于使用 GRS 的 RSV,启用跨区域还原来在主区域不可用时进行恢复。验证工作负载使用的加密密钥也具有弹性(Key Vault 软删除/清除保护,以及在需要时进行异地冗余恢复规划)。
Azure Site Recovery (ASR)
复制
- Azure 到 Azure、VMware/Hyper-V 到 Azure 以及物理服务器。定义复制策略(RPO 阈值、恢复点保留期、应用一致性快照频率)。在需要时部署 Mobility service。
恢复计划
- 通过启动顺序、手动步骤和 runbook(例如,DNS 更新、连接字符串切换)来编排多层应用的故障转移。将凭据和脚本保存在 Key Vault 中。
测试故障转移
- 定期执行到具有屏蔽 IP 的隔离 VNet 中的非中断性测试。使用“清理测试故障转移”来重置状态。理由:在不影响生产环境的情况下验证端到端的恢复过程。
故障恢复
- 主站点恢复后,重新保护并执行故障恢复,同步变更。规划带宽窗口和维护时间以满足业务 SLA。
选择满足 RTO/RPO 的架构
严格的 RPO(秒到分钟)和低 RTO(分钟)
- 优先选择 ASR 或原生应用程序复制(例如,SQL Always On、Cosmos DB 多区域),而不是备份;保持热备或温备;使用 Front Door/Traffic Manager 进行区域故障转移。
中等的 RPO(小时)和 RTO(小时)
- 将频繁备份与 ASR 结合用于关键层;使用备份加速功能(即时还原快照)来减少还原时间。
较长的 RPO(天)和 RTO(天)
- 仅使用备份并设置更长的保留期;采用成本优化的存档层。
操作原理:复制能以较高的持续成本实现较小的 RPO;备份能以较低成本实现长期保留,但 RTO/RPO 较慢。根据业务影响分析,为每个层级混合使用这两种方法。
网络防御、取证、连续性和强化
Azure DDoS 响应、WAF 调优和流量管理故障转移
DDoS Protection Standard
- 与托管公共 IP 的 VNet 关联。它在攻击期间提供自适应实时缓解和 DDoS 快速响应 (DRR) 支持。配置警报和诊断以发送到 Sentinel。理由:在流量到达工作负载之前,在边缘自动进行缓解。
WAF 调优
- 使用托管的 OWASP 规则集并切换到预防模式。为已知的良性模式添加排除项,在需要时开启请求大小/正文检查,并为滥用 IP 或地理位置创建允许/拒绝和速率限制的自定义规则。根据日志持续优化。
流量故障转移
- 使用 Traffic Manager(基于 DNS)的优先级路由和低 TTL 进行区域故障转移,或使用 Azure Front Door(任播 L7)以实现更快的由健康探针驱动的故障转移和全局入口。探测关键端点并执行定期的故障转移演练。
取证:日志和不可变保留
Activity Log
- 审计控制平面操作(创建/删除/角色分配)。流式传输到 Sentinel 和具有不可变性的 Azure Storage 以用于合法保留(legal hold)。
资源日志
- 通过诊断设置为关键服务(Key Vault、App Service、Storage、SQL、AKS)启用。路由到 Log Analytics、Event Hub 和不可变的 Storage。
NSG 流日志
- 在 Network Watcher 中启用;使用 Traffic Analytics 进行分析,以在事件期间重建网络流。
Microsoft Entra 登录和审核日志
- 摄取到 Sentinel 中用于身份调查。监控有风险的登录和条件访问结果。通过 Log Analytics 存档和/或导出到不可变的 Storage 来延长保留期。
紧急访问和连续性控制
- 维护至少两个仅限云的全局管理员紧急访问帐户,使用长而复杂的密码,并从条件访问和 MFA 策略中排除,以便在服务中断时仍能使用。将凭据安全地离线存储,并通过实时警报监控任何登录活动。在其他地方分配有限的常设角色;在正常操作期间使用 PIM 进行即时(just-in-time)权限提升。
- 记录紧急访问程序,包括 Entra 的“提升访问权限以管理所有 Azure 订阅”功能,以及在 RBAC 失效时在根管理组分配 Owner 的步骤。
- 使用管理锁 (CanNotDelete) 保护关键资产,并使用管理组限制角色分配的范围。
事件后强化
- 在管理组级别应用 Azure Policy 以强制执行基线(例如,为反恶意软件扩展、磁盘加密、诊断设置、JIT VM 访问使用 DeployIfNotExists 策略)。通过策略修复任务来修正不合规项。
- 通过调整 Sentinel 分析(添加新的 IOC、调整阈值)、将成功的搜寻(hunt)转换为计划规则以及添加自动化规则进行分类,来改进检测能力。
- 更新安全基线(镜像、Key Vault 策略、NSG/WAF 规则)。将所有变更捕获为代码(Bicep/Terraform),并通过 CI/CD 和变更控制进行验证。跟踪安全分数和法规合规性以衡量进展。
实践问题场景
星巴克(Starbucks)经历了一次可疑登录激增,随后托管订单 API 的生产订阅中出现了异常的存储出口流量。安全团队必须在遏制、调查和恢复服务的同时,保留证据并满足 API 层的两小时 RTO 和 15 分钟 RPO 要求。
- 自动化分类并控制爆炸半径
- 在 Sentinel 中,一个自动化规则在高严重性事件(包含来自订单 API 资源组的实体)上触发,将事件分配给值班分析师,标记事件为 QuarantineCandidate,并运行一个 playbook 以执行以下操作:
- 撤销被入侵用户的会话。
- 向 API 虚拟机规模集的 NIC 应用一个隔离 NSG。
- 添加一个 WAF 自定义规则以阻止攻击性 IP 范围。
- 理由:自动化在几秒钟内执行预先批准的、最小权限的操作,缩短攻击者的停留时间并防止进一步的数据泄露。
- 通过不可变性保留证据
- 该 playbook 对受影响的 VM 操作系统/数据磁盘进行快照,并将目标容器的 Activity Log、NSG 流日志和 Storage 帐户日志导出到一个配置了基于时间的不可变性和合法保留(legal hold)的 Azure Storage 帐户。书签和 KQL 查询被附加到 Sentinel 事件中。
- 理由:不可变存储确保了监管链(chain-of-custody);快照使得离线取证成为可能,而无需更改受感染的系统。
- 恢复服务以满足 RTO/RPO
- 由于 API 层受 ASR 保护,并具有 15 分钟的应用一致性快照频率,团队执行一个优先恢复计划,将 API 层故障转移到配对区域。Azure Front Door 执行基于健康探针的故障转移,切换到辅助端点。
- 理由:复制满足了 15 分钟的 RPO,而编排的故障转移加上 Front Door 路由无需从备份中恢复即可满足两小时的 RTO。
- 修复身份和密钥
- 特权管理员在 Key Vault(已启用软删除和清除保护)中轮换凭据和密钥,并禁用被入侵的帐户,同时为特权角色强制执行更强的条件访问策略。
- 理由:密钥和身份是常见的持久化途径;快速轮换和更严格的访问控制可以切断攻击者的再次进入。
- 事件后强化和验证
- 团队调整 WAF 托管规则,添加一个速率限制自定义规则,将 Storage 帐户载入到带有异常警报的 Defender for Cloud 中,并部署 Azure Policy 以默认强制执行诊断设置和 NSG 基线。添加一个 Sentinel 分析规则以检测类似的出口模式,并安排演练以每季度验证 ASR 恢复计划。
- 理由:通过策略和分析将修复措施制度化,可以减少再次发生,并确保弹性保持可验证和可重复。
练习这些题目 → · 在 ExamRoll.io 上限时练习 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
通过考试 →