AmazonAmazon Data Engineer Associate DEA-C01 Certification
·CN
·更新于 2 Aug 2026
一家游戏公司使用 Amazon Kinesis Data Streams 收集点击流事件,并使用 Kinesis Data Firehose 将 JSON 文件传输到 Amazon S3。数据科学家在 Amazon Athena 中查询最新数据。该公司希望在不重建现有数据管道的情况下降低 Athena 查询成本。哪个选项可以在满足要求的同时最大限度地减少管理工作?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 将 Firehose 配置为输出 Apache Parquet,设置自定义 S3 对象前缀(例如 YYYYMMDD)和较大的缓冲区大小。对于历史数据,运行 AWS Glue ETL 作业将小的 JSON 文件合并为带有 YYYYMMDD 前缀的较大 Parquet 文件,然后运行 ALTER TABLE ADD PARTITION 以更新现有的 Athena 表。.
为什么这是答案
正确选项通过将 Firehose 配置为直接输出 Parquet 格式,并使用日期分区(YYYYMMDD)和更大的缓冲区大小,显著降低了 Athena 查询成本。Parquet 是一种列式存储格式,查询效率高,且文件大小适中,减少了 Athena 扫描的数据量。对于历史数据,使用 AWS Glue ETL 合并小文件为更大的 Parquet 文件,进一步优化了查询性能和成本。这种方法最大限度地减少了管理工作,因为它利用了 Firehose 的内置转换能力和 Glue 的无服务器 ETL 功能,避免了重建整个数据管道。
其他选项的不足:
创建 Spark 作业需要管理 EMR 集群,增加了运维复杂性。
将数据发送到 Kinesis 数据流并使用 Apache Flink 增加了额外的组件和管理开销。
使用 Lambda 进行转换会增加 Lambda 的调用成本和管理复杂性,且可能面临并发限制。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡