一家零售公司将每日零售订单的 CSV 文件加载到单个 S3 路径中,并使用 Amazon Redshift Spectrum 查询包含 100 多列数据的数据子集。第三方源每天生成超过 30 个 CSV 文件(每个文件 50-70 MB)。用户聚合每日指标,但查询性能已下降。以下哪种操作组合能以最少的开发工作量解决性能问题?(选择两项)
选择一个答案
点击一个选项来检查您的答案。
正确答案: 配置第三方应用程序以列式格式生成文件。, 按订单日期对 S3 存储桶中的订单数据进行分区。.
为什么这是答案
将数据存储为列式格式(如Parquet或ORC)可以显著提高Redshift Spectrum的查询性能,因为它只读取查询所需的列,减少了数据扫描量。CSV是行式格式。按订单日期对S3存储桶中的数据进行分区,可以使Redshift Spectrum在查询时只扫描相关日期的数据,而不是整个数据集,从而大幅减少扫描的数据量和查询时间。将多个CSV文件合并为一个文件会创建更大的文件,可能导致Redshift Spectrum在查询时需要读取更多数据,并且无法利用并行处理的优势。JSON格式也是行式格式,不会带来列式存储的性能优势。将JSON数据加载到Redshift的SUPER类型列中是Redshift内部的存储优化,与Redshift Spectrum查询S3上的外部数据性能提升关系不大。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡