一家公司希望对S3数据湖中的数据运行ML分析。他们有两种转换需求:(1) 对每天在固定时间到达的300 GB各种格式数据执行计划的日常转换,以及(2) 对数据湖中TB级的归档数据运行一次性转换。Amazon MWAA DAG将编排这些工作流。DAG应该调度哪两项任务来最经济高效地满足这些需求?(选择两项。)
选择一个答案
点击一个选项来检查您的答案。
正确答案: 对于每日传入数据,使用AWS Glue爬网程序扫描并识别模式。, 对于每日数据和归档数据,使用Amazon EMR执行数据转换。.
为什么这是答案
AWS Glue爬网程序能够自动扫描S3数据湖中的各种格式数据,识别其模式并将其元数据存储在AWS Glue数据目录中。这对于每日固定时间到达的300 GB数据来说,是一种经济高效且自动化的解决方案,因为它无需手动定义模式,并能适应数据格式的变化。Amazon EMR是一个托管的Hadoop框架,非常适合处理TB级的数据转换任务,无论是每日数据还是归档数据。它提供了高度可扩展性和灵活性,可以运行各种大数据处理框架(如Spark、Hive等),从而经济高效地执行复杂的转换逻辑。 Amazon Athena虽然可以扫描S3数据,但其主要功能是交互式查询,而不是自动模式识别和元数据管理,因此不适合作为每日数据模式识别的首选。Amazon Redshift是一个数据仓库服务,主要用于结构化数据的分析查询,不适合作为数据湖中原始数据转换的工具。Amazon SageMaker是机器学习服务,主要用于模型训练和部署,而不是大规模数据转换。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡