AmazonAmazon Data Engineer Associate DEA-C01 Certification
·CN
·更新于 2 Aug 2026
一家公司每天在 S3 中接收一个大约 2 GB 的 .xls 客户数据文件。数据工程师需要连接名字和姓氏列,并计算文件中不同客户的数量。哪种方法所需的操作工作量最少?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用 AWS Glue DataBrew 创建一个配方,该配方使用 COUNT_DISTINCT 聚合函数来计算不同客户的数量。.
为什么这是答案
AWS Glue DataBrew 提供了无代码或低代码的数据准备功能,非常适合处理日常的、结构化的数据文件,如本例中的 .xls 文件。通过创建配方 (recipe) 并使用内置的 COUNTDISTINCT 聚合函数,可以直观地完成名字和姓氏的连接以及去重计数,操作工作量最少。
其他选项虽然也能实现目标,但操作工作量相对较大:
在 AWS Glue notebook 或 Amazon EMR Serverless 中运行 Apache Spark 作业需要编写和维护代码,对于这种简单的任务来说,工作量更多。
使用 AWS Glue crawler 和 Amazon Athena 需要先创建 Data Catalog,然后编写 SQL 查询,虽然可行,但 DataBrew 提供更直接、更可视化的数据准备体验。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡