AmazonAmazon Data Engineer Associate DEA-C01 Certification
·CN
·更新于 2 Aug 2026
一位数据工程师需要将结构化的 .csv 文件(15 列)加载到 Amazon S3 数据湖中。分析师运行 Amazon Athena 查询时通常只引用一两列,并且很少扫描整个文件。哪种方法最具成本效益?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 创建 AWS Glue 提取、转换和加载 (ETL) 作业,从 .csv 结构化数据源读取数据。将作业配置为以 Apache Parquet 格式将数据写入数据湖中。.
为什么这是答案
正确答案是使用 AWS Glue ETL 作业将数据转换为 Apache Parquet 格式。Parquet 是一种列式存储格式,非常适合分析查询,因为它允许 Athena 只读取查询所需的列,从而显著减少扫描的数据量并降低成本。此外,Parquet 支持数据压缩和编码,进一步优化了存储和查询性能。
将数据以 .csv 格式直接摄取到数据湖中(选项 A)会导致 Athena 在查询时扫描整个文件,即使只需要一两列,成本会很高。将数据转换为 JSON 格式(选项 B)虽然比 CSV 更具结构化,但它仍然是行式存储,不具备 Parquet 的列式读取优势。Apache Avro(选项 C)是一种行式存储格式,虽然它支持模式演进,但在成本效益方面不如列式存储的 Parquet。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡