AmazonAmazon Machine Learning Specialty MLS-C01
·CN
·更新于 26 Jul 2026
一位数据科学家必须将本地 ETL 流程迁移到 AWS。当前流程按计划运行,并使用 PySpark 将多个大型数据源合并和格式化为一个整合输出,供下游作业使用。云解决方案的要求是:组合多个源、重用现有 PySpark 代码、按现有计划运行,并最大限度地减少要管理的服务器数量。哪种架构符合这些要求?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 将原始数据存储在 Amazon S3 中。创建一个用 PySpark 实现的 AWS Glue ETL 作业以重用现有逻辑。配置 AWS Glue 触发器以按当前计划运行,并让作业将其处理后的输出写入 Amazon S3 中的处理位置以供下游使用。.
为什么这是答案
正确答案是使用 AWS Glue ETL 作业。AWS Glue 是一种无服务器数据集成服务,支持 PySpark,可以直接重用现有的 PySpark 代码,满足了重用代码和最小化服务器管理的要求。AWS Glue 触发器可以按现有计划运行作业。将原始数据和处理后的输出存储在 Amazon S3 中是处理大量数据的标准做法。
第一个选项中,持久性 Amazon EMR 集群需要管理服务器,不符合最小化服务器数量的要求。第三个选项中,AWS Lambda 不适合处理大型数据源的 PySpark 逻辑,且在 Lambda 中重新实现 PySpark 逻辑效率低下。第四个选项中,Amazon Kinesis Data Analytics 主要用于流式数据处理,不适用于按计划运行的批处理 ETL 流程,且 SQL 查询无法直接重用 PySpark 代码。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡