一位数据工程师针对 Amazon S3 中的数据运行 Amazon Athena 查询,并使用 AWS Glue Data Catalog 获取元数据。由于 S3 数据集的分区数量非常庞大,查询规划速度很慢。哪些操作可以减少 Athena 规划时间并解决瓶颈?(选择两项)
选择一个答案
点击一个选项来检查您的答案。
正确答案: 创建 AWS Glue 分区索引。启用分区筛选。, 基于 S3 存储桶前缀使用 Athena 分区投影。.
为什么这是答案
当 Athena 查询规划速度因 S3 数据集分区数量庞大而变慢时,创建 AWS Glue 分区索引并启用分区筛选是有效的解决方案。分区索引可以显著加速 Athena 发现和筛选相关分区元数据的过程,减少规划时间。 另一个有效方法是基于 S3 存储桶前缀使用 Athena 分区投影。分区投影允许 Athena 根据预定义的模式自动推断分区,而不是扫描 Glue Data Catalog 中的所有分区元数据,这对于具有可预测分区结构的超大规模数据集特别有用,可以大幅缩短规划时间。 将数据分桶通常用于优化查询性能,但主要针对数据扫描和连接操作,对分区规划速度的直接影响较小。将数据转换为 Apache Parquet 格式可以提高查询性能,因为它是一种列式存储格式,但它主要优化数据读取效率,而不是分区规划。使用 S3DistCP 合并小对象可以减少 S3 请求开销,但对 Glue Data Catalog 中分区元数据的处理速度没有直接影响。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡