一家公司使用 Amazon S3 作为数据湖,并使用多节点 Amazon Redshift 集群作为数据仓库。数据湖中的数据文件按来源组织,公司目前为每个文件位置发出单独的 COPY 命令,以将数据加载到单个 Redshift 表中,这很慢。公司需要在不增加成本的情况下加快数据摄取。他们应该怎么做?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 创建一个包含数据文件位置的清单文件。使用 COPY 命令将数据加载到 Amazon Redshift 中。.
为什么这是答案
正确答案是创建一个包含数据文件位置的清单文件,然后使用 COPY 命令将数据加载到 Amazon Redshift 中。Amazon Redshift 的 COPY 命令支持使用清单文件来指定要加载的多个文件,这允许一次性加载来自不同 S3 路径的数据,从而显著提高数据摄取效率。这比为每个文件位置发出单独的 COPY 命令要快得多,并且不会增加额外成本。 其他选项: 使用预置的 Amazon EMR 集群会增加成本,且将所有数据文件复制到一个文件夹再加载,效率提升有限。 将数据加载到 Amazon Aurora 并使用 AWS Glue 作业再加载到 Redshift 会增加额外的存储和计算成本,并且引入不必要的复杂性和延迟。 使用 AWS Glue 作业将所有数据文件复制到一个文件夹会增加计算成本,且复制操作本身可能成为瓶颈,不如直接使用清单文件高效。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡