一位数据科学家在 Amazon S3 中有 20 TB 的 CSV 数据,需要以最省力的方式将其转换为 Apache Parquet。执行此转换最简单的方法是什么?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 编写一个转换脚本,并将其作为 AWS Glue job 运行,以读取 CSV 并写入 Parquet 输出。.
为什么这是答案
正确答案是编写一个转换脚本,并将其作为 AWS Glue job 运行,以读取 CSV 并写入 Parquet 输出。AWS Glue 是一种无服务器数据集成服务,非常适合大规模数据转换任务。它支持多种数据源和目标,包括 S3 上的 CSV 和 Parquet。通过编写一个简单的 PySpark 或 Scala 脚本,您可以轻松地定义转换逻辑,然后将其作为 Glue 作业运行,Glue 会自动处理集群管理、扩展和容错,从而实现最省力的转换。 使用 AWS Glue crawler 只能发现数据模式并创建表,不能执行数据转换。编写脚本并在 Amazon EMR 集群上运行虽然可行,但需要您管理 EMR 集群的配置和生命周期,不如 Glue job 无服务器方式省力。在 Amazon SageMaker notebook 中运行脚本适用于探索性分析和小型数据集,但对于 20 TB 的大规模数据转换,效率和成本效益不如 Glue job。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡