一家公司每天运行一个 ETL 管道,该管道以 Python 脚本的形式在一台大型 EC2 实例上实现,用于清理、转换、丰富和压缩存储在 S3 中的数 TB 用户交互数据。该过程需要 20 多个小时,他们希望从 EC2 迁移到托管的无服务器解决方案,并尽量减少开发工作。哪种方法符合这些要求?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 创建一个 AWS Glue 作业,将脚本转换为 PySpark,运行 Glue 作业处理数据,并将结果存储在 S3 中。.
为什么这是答案
正确答案是创建一个 AWS Glue 作业,将脚本转换为 PySpark,运行 Glue 作业处理数据,并将结果存储在 S3 中。AWS Glue 是一种无服务器数据集成服务,非常适合处理存储在 S3 中的大量数据。它支持 PySpark,这意味着现有的 Python ETL 脚本可以相对容易地转换为 PySpark,从而最大限度地减少开发工作。Glue 作业可以处理数 TB 数据,并显著缩短处理时间,满足了从大型 EC2 实例迁移的需求。 将数据加载到 Amazon Redshift 中需要将数据从 S3 移动到 Redshift,这增加了复杂性,并且 SQL 可能无法完全复制现有的 Python 转换逻辑。将数据加载到 Amazon DynamoDB 不适合处理数 TB 的分析数据,DynamoDB 是一个 NoSQL 数据库,主要用于事务性工作负载。将每个脚本实现为单独的 AWS Lambda 函数,并使用 Step Functions 进行编排,对于处理数 TB 数据来说效率不高,Lambda 函数有执行时间限制,并且编排大量数据处理任务会变得复杂。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡