某公司每天从 SAP HANA、SQL Server、MongoDB、Kafka 和 DynamoDB 等来源提取大约 1 TB 的数据。其中一些来源的架构未定义或不断演变。解决方案必须在数据创建后 15 分钟内检测架构、执行 ETL 并将数据加载到 S3 中。哪种方法能够以最少的运营开销提供所需的功能?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用 AWS Glue 检测架构,并将数据提取、转换和加载到 S3 存储桶中。在 Apache Spark 中创建管道。.
为什么这是答案
AWS Glue 是一款完全托管的 ETL 服务,非常适合处理来自多种来源(包括结构化和半结构化数据)的每日 1 TB 数据。它内置的 Glue Data Catalog 能够自动检测并管理不断演变的架构,满足了“架构未定义或不断演变”的需求。Glue 支持 Apache Spark,允许创建高效的 ETL 管道,并将数据加载到 S3,同时其无服务器特性显著降低了运营开销。 其他选项的不足: Amazon EMR 需要管理 EC2 实例集群,运营开销较高。 AWS Lambda 适用于轻量级、事件驱动的任务,但对于每日 1 TB 的数据处理,其运行时限制和内存限制使其不适合作为主要的 ETL 引擎。 Amazon Redshift 主要用于数据仓库分析,虽然 Redshift Spectrum 可以查询 S3 上的数据,但其存储过程不擅长通用 ETL 任务,且 Redshift 本身不是一个通用的 ETL 工具,无法直接检测多种来源的架构并执行 ETL 到 S3。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡