数据工程师每月将训练数据从 Amazon Redshift 提取到 Amazon S3。源模式包括 TransactionTimestamp (timestamp)、CardName (varchar) 和 CardNo (varchar)。工程师必须 (1) 删除 CardNo = NULL 的行,(2) 将 TransactionTimestamp 拆分为 TransactionDate 和 TransactionTime,以及 (3) 将 CardName 重命名为 NameOnCard。该解决方案必须最大限度地减少基础设施设置,每月自动运行,并对 Redshift 集群施加最小负载。哪种解决方案符合这些要求?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 创建一个 AWS Glue 作业,使用 Amazon Redshift 集群作为源,S3 存储桶作为目标。使用 Glue 内置转换(Filter、Map、RenameField)应用所需的更改并每月调度该作业。.
为什么这是答案
正确答案是创建一个AWS Glue作业,因为它能满足所有要求。AWS Glue是无服务器的,最大限度地减少了基础设施设置。它支持从Redshift读取数据,并提供内置的转换功能(如Filter用于删除空值,Map用于拆分时间戳,RenameField用于重命名列),可以直接在作业中完成数据转换。Glue作业可以按月调度自动运行。此外,Glue通过其连接器优化了与Redshift的交互,通常对Redshift集群施加较小的负载。 其他选项的不足之处: 预置Amazon EMR集群需要管理基础设施,不符合“最小化基础设施设置”的要求。 从EC2实例手动运行SQL查询并将结果上传到S3,不符合“每月自动运行”的要求,且需要手动管理EC2实例。 Amazon Redshift Spectrum用于查询S3上的数据,而不是将Redshift数据导出到S3,且Redshift Spectrum本身不提供数据转换能力,需要额外的Lambda函数来调度,增加了复杂性。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡