Amazon DOP-C02: 监控、日志记录和可观测性 — 学习指南

属于 AWS DevOps Engineer Professional DOP-C02 — 学习指南. 使用经过验证的答案练习: Amazon 考试中心, 或参加限时模拟考试: ExamRoll.io.

概览

AWS 上的监控、日志记录和可观测性需要将指标、日志、追踪、事件和健康遥测数据组合成可操作的信号。有效的架构会使用 Amazon CloudWatch 进行指标、告警和控制面板的监控;使用 CloudWatch Logs 和 Logs Insights 进行日志摄取和分析;使用 AWS X-Ray 进行分布式追踪;使用 AWS CloudTrail 进行审计和完整性验证;使用 Amazon EventBridge 进行事件驱动的检测和自动化;使用 AWS Health 获取特定于账户的服务事件;并使用集中式管道(Kinesis Data Firehose 和 OpenSearch)进行大规模的搜索和关联。以下模式强调了降噪、精确的信号路由、自动化以及多账户/多区域操作。

CloudWatch 指标、告警、控制面板和复合告警

CloudWatch 指标是 SLO、扩展和告警的基础。发布带有细粒度维度的自定义指标以隔离信号(例如,apiOperation、appVersion、statusCode)。将 CloudWatch 嵌入式指标格式 (EMF) 与结构化日志结合使用,可以高效地从 Lambda、容器和 EC2 发出高基数维度的指标,从而避免 PutMetricData API 的开销。

配置具有稳健评估机制的告警:

复合告警通过 AND/OR 逻辑组合多个底层告警,从而减少告警疲劳。例如,仅当 p95 延迟过高、5xx 错误率超过阈值且 CPU 饱和度持续存在时才发出告警,从而与用户受到的实际影响保持一致。复合告警可以通过跨账户可观测性或将指标流式传输到中心账户的方式,接受来自跨区域/跨账户的子告警的状态更新。

控制面板可以跨服务可视化关键指标。使用小组件展示指标、Logs Insights 查询结果和告警状态。标准化控制面板的约定(命名、时间范围、SLO 叠加层),并利用 CloudWatch Observability Access Manager (OAM) 实现跨区域/跨账户视图。为了进行即席关联,可以将 Logs Insights 和 X-Ray ServiceLens 小组件与服务地图小组件和 Kinesis Firehose 错误率并排固定。

CloudWatch Logs:日志组、指标筛选器、订阅筛选器和 Logs Insights

按应用程序/组件和生命周期阶段来组织日志组。设置明确的保留策略(不要依赖“永不过期”),并在需要时启用 KMS 加密。使用资源策略和细粒度的 IAM 来控制生产者和订阅者。对于高吞吐量摄取,请确保足够的日志流并发和批处理能力。

指标筛选器可将日志模式转换为指标。定义一个带有提取令牌(JSON 或空格分隔)的筛选模式,并将令牌映射到指标维度。这支持了诸如按 API、按版本、按响应代码生成指标等用例,这些指标可以直接从日志发布,而无需修改生产者。确保单位和默认值正确;首选每个事件为 1,并通过指标数学派生出速率。使用这些指标进行 SLO 告警和控制面板展示。

订阅筛选器可将日志近乎实时地流式传输到:

CloudWatch Logs Insights 提供对日志的交互式、无服务器查询。核心操作符包括 fields、filter、parse、stats、sort、limit、dedup 和用于时间分桶的 bin。可以解析 JSON 字段或对文本日志使用类似 grok 的解析。示例:

undefined

undefined

使用 QueryDefinition 保存常用查询以供团队复用,并将它们作为查询小组件嵌入到控制面板中。为了实现自动化,可以通过 EventBridge 调度一个 Lambda 来运行 StartQuery/GetQueryResults,并将摘要发布到 SNS 或 OpsCenter。将查询范围限制在特定的日志组和时间窗口内以控制成本。

使用 Kinesis Data Firehose 和 OpenSearch 实现集中式日志记录

多账户、多区域的日志记录策略可以标准化日志的摄取和搜索。在每个生产者账户中,配置 CloudWatch Logs 订阅筛选器,将其指向一个由中央 Kinesis Data Firehose 支持的跨账户日志目标。启用 Firehose 的以下功能:

将此管道与 CloudWatch 指标筛选器结合使用,以实现快速、低成本的计数器;并与 Logs Insights 结合使用,以进行临时的深度查询。使用由 Firehose/OpenSearch 异常或 CloudWatch 警报触发的 EventBridge 规则来启动修复措施或引发事件。

实际问题场景

Airbnb 部署在 EKS 和 Lambda 上的微服务出现了间歇性的 API 错误和延迟峰值,同时有多个移动应用版本在线上运行。运维团队需要近乎实时地按 API 操作、响应代码和应用版本进行检测;跨越跟踪和日志进行快速的根因分析;对已知的故障模式进行自动化修复;并建立符合治理要求的审计追踪。

  1. 标准化结构化日志记录
  1. 创建 CloudWatch Logs 指标筛选器
  1. 构建分层 CloudWatch 警报和复合警报
  1. 部署带有目标采样的 X-Ray 跟踪
  1. 与 ServiceLens 和 Logs Insights 关联分析
  1. 通过 Firehose 将日志集中到 OpenSearch 和 S3
  1. 使用 EventBridge 实现自动化检测和修复
  1. 集成 AWS Health 和维护处理
  1. 通过 CloudTrail 组织跟踪和完整性验证来强化治理
  1. 通知和运维集成

选择此设计是为了结合低延迟、维度丰富的指标 (CloudWatch + EMF)、深度跟踪关联 (X-Ray + ServiceLens)、大规模搜索 (OpenSearch + S3/Athena)、事件驱动的修复 (EventBridge + Lambda/SSM/Step Functions) 以及可审计的治理 (CloudTrail 完整性验证)。它通过采样、分层保留和反映真实用户影响的目标性警报,在成本和保真度之间取得了平衡。


基础架构即代码和配置管理 · 所有领域 · 安全、合规性和治理

练习这些题目 → · 在 ExamRoll.io 上限时练习 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

通过考试 →

浏览 Amazon →

Related guides

一体化访问

一次订阅。所有考试。

所有计划均可无限制搜索答案、进行模拟测试、获取AI解释以及访问完整的资源库 — 支持20多种语言。

每月
24.87
Just €0.83/day
包含所有内容:
  • 无限答案搜索
  • 无限模拟测试
  • AI驱动的解释
  • 完整资源库
  • 20多种语言
  • 每周内容更新
  • 奖励与推荐
  • 优先支持
开始免费试用

无需信用卡*

最具价值
12个月
179.87
Just €0.49/daySave 40%
包含所有内容:
  • 无限答案搜索
  • 无限模拟测试
  • AI驱动的解释
  • 完整资源库
  • 20多种语言
  • 每周内容更新
  • 奖励与推荐
  • 优先支持
开始免费试用

无需信用卡*

✓ 包含免费计划 · ✓ 随时取消 · ✓ 所有计划均解锁完整产品