AmazonAmazon Data Engineer Associate DEA-C01 Certification
·CN
·更新于 2 Aug 2026
一家在线零售商将ALB访问日志存储在S3中,并使用Amazon Athena查询这些日志。工程师创建了一个未分区的Athena表,但随着数据量的增加,查询响应时间也随之增长。哪种方法能以最少的操作工作量提高Athena查询性能?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 创建一个AWS Glue爬网程序,使用分类器确定所有ALB访问日志的schema,并将分区元数据写入AWS Glue Data Catalog。.
为什么这是答案
正确答案是创建一个AWS Glue爬网程序,使用分类器确定所有ALB访问日志的schema,并将分区元数据写入AWS Glue Data Catalog。这是因为ALB访问日志通常以日期或小时为单位进行分区,而Athena查询性能可以通过分区大大提高。AWS Glue爬网程序可以自动发现S3中的数据分区,并将其元数据添加到Glue Data Catalog,从而使Athena能够利用这些分区进行查询优化,且操作工作量最小。
创建一个AWS Glue作业也可以实现分区,但爬网程序更适合自动发现和维护分区元数据,尤其是在数据结构相对固定但持续增长的情况下。将日志转换为Parquet格式并使用Lambda函数虽然能提高查询性能,但增加了数据转换的复杂性和操作开销。使用Apache Hive创建分桶表并结合Lambda函数则过于复杂,且通常不适用于ALB访问日志这种流式数据。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡