Amazon DEA-C01: 数据质量、验证和可观测性 — 学习指南

属于 Amazon Data Engineer Associate DEA-C01 — 学习指南. 使用经过验证的答案练习: Amazon 考试中心, 或参加限时模拟考试: ExamRoll.io.

该领域涵盖了用于确保数据正确性、检测异常并保持管道可靠性的端到端实践和 AWS 服务。强大的验证和可观测性可以减少下游缺陷,满足 SLA 并实现安全的重新处理。数据工程师必须结合使用 Glue Data Quality、验证框架、CloudWatch 异常检测、DLQ(死信队列)和幂等设计来构建稳健的管道。

AWS Glue Data Quality 规则和评估

Glue Data Quality 使用数据质量定义语言 (DQDL) 规则集来定义关于数据集的断言(例如行数、空值阈值、唯一性、自定义 SQL 检查)。您可以在控制台中或使用 CLI 创建规则集(示例模式:aws glue create-data-quality-ruleset –name MyRuleset –rules file://dqdl.json)。规则集可以附加到 Glue ETL 作业,也可以通过 StartDataQualityRuleRecommendationRun / StartDataQualityRulesetEvaluationRun API 独立运行,以评估存储在 S3、目录表或 Glue DynamicFrames 中的数据集。

关键配置细节和决策标准:

何时使用 Glue Data Quality 与外部框架的对比:

管道中的数据验证模式

验证应位于多个接触点:入口 (ingress)、转换 (transformation) 和输出 (sink)。常见模式:

验证选项的比较:

选项 优点 缺点
Glue DQDL 原生集成,运维开销低,将结果写入 Glue 目录/指标 对于复杂的逻辑期望,表达能力较弱
Great Expectations 丰富的期望库、数据文档、集成检查点、可扩展的后端 需要在 S3 中打包和管理期望产物,并在 Glue 作业中进行编排
代码中的手动检查 (Spark/DataFrame) 完全的灵活性,自定义逻辑的高性能 维护成本更高,需要额外工作才能实现标准化报告

对于流式处理,验证传输中的记录,并在失败时将其推送到 SQS DLQ(死信队列)(通过 AWS CLI 或控制台配置带有 maxReceiveCount 的 RedrivePolicy),而不是直接丢弃。对于批处理,生成验证报告产物,并根据策略使输出失败或隔离输出。

异常检测和数据漂移监控

使用 CloudWatch 异常检测来监控运营指标(处理的记录数、错误率、作业持续时间)。使用 CLI 创建一个检测器:aws cloudwatch put-anomaly-detector –namespace “Glue” –metric-name “JobRunTime” –statistic “Average” –single-metric-anomaly-detector ‘{“MetricName”:“JobRunTime”,“Namespace”:“Glue”,“Stat”:“Average”,“Dimensions”:[…]}’,然后创建引用该异常检测范围的 CloudWatch 告警。对于数据级漂移(分布变化、空值率变化),调度 Glue DataBrew profile 作业 (aws databrew create-profile-job) 以计算统计数据、直方图和分位数;将配置文件作为基线存储在 S3 中。

异常检测告警与阈值告警的决策标准:

对于自动化漂移检测:

SLA 管理与管道可靠性

SLA 管理将可观测性与修复及可靠性工程联系起来。为每个管道配置这些基线指标:吞吐量 (记录/秒)、延迟 (从摄入到接收器)、错误率、作业/运行时长以及下游计数。使用 CloudWatch Metrics 监控 Glue 作业 (作业运行指标)、Kinesis/Kafka 消费者延迟,并通过 PutMetricData 监控自定义应用程序指标。

可靠性模式和配置详情:

重试与快速失败的决策标准:

常见陷阱与决策标准

实践问题:用例场景

Streamline Retail 公司在夜间 ETL 后,下游报表频繁出错:偶尔出现模式突变、静默的规则违反,以及在重处理失败的运行时产生重复订单。

  1. 实施 Glue Data Quality 规则 (DQDL),对模式、空值阈值和 order_id 的唯一性进行检查;将失败时的操作设置为 FAIL 作业,并将评估产物发布到 S3。
  2. 在一个 Glue Python Shell 步骤中添加 Great Expectations,用于复杂的业务检查 (如跨表的订单一致性);将期望 (expectations) 存储在 S3 中,并在管道中运行检查点。
  3. 调度 DataBrew 分析作业以捕获每日基线 (如基数、空值率、百分位数),并使用自动化比较来检测数据漂移。
  4. 对于流式订单事件,配置带有适当 RedrivePolicy 的 SQS DLQ,并创建一个重放作业,以幂等方式处理 DLQ 消息 (使用 order_id 作为去重键)。
  5. 为作业运行时长和错误计数配置 CloudWatch 异常检测器;将基于异常的警报附加到 SNS,用于待命升级。

AWS 最佳实践基本原理:结合使用原生 Glue 质量控制以实现快速集成,使用 Great Expectations 增强表达能力,使用 DataBrew 获取基线统计数据,并使用 CloudWatch 异常检测器进行自适应监控。DLQ 和幂等接收器为安全重试和重处理形成了闭环,同时保障了 SLA。


数据工作负载成本优化 · 所有领域

练习这些题目 → · 在 ExamRoll.io 上限时练习 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

通过考试 →

浏览 Amazon →

Related guides

一体化访问

一次订阅。所有考试。

所有计划均可无限制搜索答案、进行模拟测试、获取AI解释以及访问完整的资源库 — 支持20多种语言。

每月
24.87
Just €0.83/day
包含所有内容:
  • 无限答案搜索
  • 无限模拟测试
  • AI驱动的解释
  • 完整资源库
  • 20多种语言
  • 每周内容更新
  • 奖励与推荐
  • 优先支持
开始免费试用

无需信用卡*

最具价值
12个月
179.87
Just €0.49/daySave 40%
包含所有内容:
  • 无限答案搜索
  • 无限模拟测试
  • AI驱动的解释
  • 完整资源库
  • 20多种语言
  • 每周内容更新
  • 奖励与推荐
  • 优先支持
开始免费试用

无需信用卡*

✓ 包含免费计划 · ✓ 随时取消 · ✓ 所有计划均解锁完整产品