Amazon DEA-C01: 数据存储和数据湖架构 — 学习指南

属于 Amazon Data Engineer Associate DEA-C01 — 学习指南. 使用经过验证的答案练习: Amazon 考试中心, 或参加限时模拟考试: ExamRoll.io.

本领域涵盖 AWS 存储服务和数据库引擎如何支持现代数据平台中的大规模数据摄取、持久化归档、查询性能和安全治理。数据工程师必须在成本、访问延迟、持久性和精细化访问控制之间取得平衡,同时将 S3、Lake Formation、Redshift 和 DynamoDB 等服务集成到管道中。理解存储类别权衡、生命周期自动化、托管存储与本地存储的对比以及分区模式,可以避免在生产环境中出现性能和成本方面的意外。

Amazon S3 存储类别和生命周期策略

S3 提供多种存储类别和生命周期控制,以优化成本和访问模式。可在上传时配置存储类别(通过控制台或 CLI:aws s3 cp file s3://bucket/key –storage-class INTELLIGENT_TIERING),或使用存储桶生命周期规则(aws s3api put-bucket-lifecycle-configuration –bucket my-bucket –lifecycle-configuration file://lifecycle.json)。Intelligent-Tiering 会在频繁访问层和不频繁访问层之间自动移动对象,并收取少量监控费用;对于未知或变化的访问模式,应启用此功能。使用生命周期规则将对象转换为 GLACIER 或 DEEP_ARCHIVE 以进行长期保留,并使旧版本过期/删除。

决策标准和权衡:

操作说明:

使用 S3 和 Lake Formation 设计数据湖

使用 S3 作为中央对象存储,并使用 Lake Formation 进行集中式访问控制和编目,来设计数据湖。将 S3 位置注册为 Lake Formation 资源,设置 AWS Glue Data Catalog,并对数据库/表使用 Lake Formation 授权(aws lakeformation grant-permissions –principal arn:aws:iam::123456789012:user/analyst –permissions SELECT –resource ‘{…}’)。Lake Formation 可以强制执行精细化控制:通过应用于 Glue/Athena 查询的 LF-tag 和数据筛选器,实现列级别、行级别(筛选表达式)和单元格级别的屏蔽。

关键配置和治理模式:

决策点:

Amazon Redshift 架构和存储

Redshift 在 RA3 节点上将计算与托管存储分离,而 DS2 节点则使用本地 SSD 支持的存储。RA3 节点使用 Redshift 托管存储 (RMS),数据存储在由集群管理的 Amazon S3 上;选择 RA3 可获得可扩展的存储、一致的查询性能,并能为计算单独付费。DS2 节点将数据存储在实例本地磁盘上,这需要在数据增长时进行仔细的容量规划和大小调整。

配置和操作细节:

比较 (RA3 vs DS2):

DynamoDB 与专用数据库选型

对于需要个位数毫秒级延迟的大规模键值和文档工作负载,应选择 DynamoDB。表设计取决于分区键(以及可选的排序键)的选择:使用高基数、分布均匀的键以避免热分区。对于顺序或基于时间戳的键,应实施随机前缀(分片)或使用 UUID 来分散写入。使用按需容量以避免预置,但对于可预测的工作负载,可考虑使用带自动扩展的预置容量,并利用自适应容量处理热分区。

实用配置说明:

undefined

引擎选型决策标准:

常见陷阱与决策标准

实践问题:用例场景

Acme Media 公司必须存储 50 TB 的原始视频采集数据,为分析师提供对转换后元数据的查询访问,并为不同业务部门强制实施行级和列级访问控制,同时最小化存储成本。

  1. 使用分段上传将原始视频采集到 S3,按采集日期和数据集为对象添加标签,对初始的未知访问模式使用 Intelligent-Tiering。
  2. 配置生命周期规则,在可配置的保留期后将媒体转换到 GLACIER 或 DEEP_ARCHIVE(如果考虑使用 Standard-IA,确保其保留期与 30 天以上的要求对齐)。
  3. 在 Lake Formation 中注册 S3 位置,构建 Glue 爬网程序以填充数据目录,并向业务部门授予基于 LF 标签的行级和列级权限。
  4. 将经过整理的元数据存储在 Redshift RA3 中用于分析;将一个 IAM 角色附加到集群以支持从 S3 进行 COPY 操作,并在维护窗口内执行 VACUUM/ANALYZE 操作。
  5. 使用带有哈希 UUID 键的 DynamoDB 作为视频清单的高吞吐量查找表,并启用按需容量以吸收流量峰值。

基本原理:此方法通过 Glacier 存储类隔离了冷存储成本,使用 Intelligent-Tiering 应对未知访问模式,应用 Lake Formation 在多个分析引擎间实现安全的精细访问控制,并选择 RA3 作为可扩展的分析存储,同时由 DynamoDB 处理低延迟的操作性查找。


数据摄取和收集 · 所有领域 · 数据编目和元数据管理

练习这些题目 → · 在 ExamRoll.io 上限时练习 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

通过考试 →

浏览 Amazon →

Related guides

一体化访问

一次订阅。所有考试。

所有计划均可无限制搜索答案、进行模拟测试、获取AI解释以及访问完整的资源库 — 支持20多种语言。

每月
24.87
Just €0.83/day
包含所有内容:
  • 无限答案搜索
  • 无限模拟测试
  • AI驱动的解释
  • 完整资源库
  • 20多种语言
  • 每周内容更新
  • 奖励与推荐
  • 优先支持
开始免费试用

无需信用卡*

最具价值
12个月
179.87
Just €0.49/daySave 40%
包含所有内容:
  • 无限答案搜索
  • 无限模拟测试
  • AI驱动的解释
  • 完整资源库
  • 20多种语言
  • 每周内容更新
  • 奖励与推荐
  • 优先支持
开始免费试用

无需信用卡*

✓ 包含免费计划 · ✓ 随时取消 · ✓ 所有计划均解锁完整产品