您需要使用 Amazon Athena 查询 Amazon S3 中的数据集。该数据集包含超过 800,000 条 CSV 记录;每条记录有 200 列,大小约为 1.5 MB,但大多数查询只访问 5-10 列。哪种格式转换能最大限度地缩短查询运行时长?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 将数据集转换为 Apache Parquet 列式格式。.
为什么这是答案
将数据集转换为 Apache Parquet 列式格式能最大限度地缩短查询运行时长。Parquet 是一种列式存储格式,这意味着它按列存储数据,而不是按行存储。当查询只需要访问少量列时,Athena 可以只读取这些特定列的数据,从而显著减少扫描的数据量和查询执行时间。 将数据集转换为 JSON 或 XML 格式通常会导致更大的文件大小和更长的查询时间,因为这些格式是基于行的,并且通常包含更多的元数据开销。使用 GZIP 压缩 CSV 文件虽然可以减少存储空间和传输成本,但查询时仍需扫描所有列,因为它仍然是行式存储格式,无法像 Parquet 那样实现列剪裁(column pruning)。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡