某公司有一个 S3 文件夹,其中包含混合文件类型(CSV、JSON、XLSX 和 Apache Parquet)。一位机器学习工程师将使用 AWS Glue DataBrew 处理数据,并且必须将最终输出保存回 S3,以便 AWS Glue 稍后可以消费。哪种方法满足这些要求?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 按文件类型将文件分离到单独的文件夹中,使用 DataBrew 处理每个文件夹,并以 Apache Parquet 格式写入输出。.
为什么这是答案
正确答案是“按文件类型将文件分离到单独的文件夹中,使用 DataBrew 处理每个文件夹,并以 Apache Parquet 格式写入输出。” DataBrew 在处理数据时,通常要求输入数据具有统一的结构或格式。将不同文件类型(CSV、JSON、XLSX、Parquet)混合在一个S3文件夹中,会导致DataBrew无法有效地推断统一的Schema进行处理。因此,将文件按类型分离到单独的文件夹中,可以确保DataBrew能够针对每种文件类型正确地摄取和处理数据。最终将输出保存为Apache Parquet格式是最佳实践,因为Parquet是一种优化的列式存储格式,能显著提高后续AWS Glue作业的读取性能和效率。 其他选项不正确的原因: 直接使用DataBrew处理混合文件类型的S3文件夹通常不可行,因为DataBrew难以处理异构数据源。 “AWS Glue Parquet格式”并非一个标准的数据格式,正确的说法是Apache Parquet格式,AWS Glue可以很好地消费Apache Parquet格式的数据。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡