一家公司正在使用 Amazon S3 作为数据湖,Amazon Redshift 作为数据仓库来构建分析平台。该公司打算使用 Amazon Redshift Spectrum 查询 S3 数据。哪些操作可以实现最快的查询性能?(选择两项。)
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用列式存储文件格式。, 根据最常见的查询谓词对数据进行分区。.
为什么这是答案
选择列式存储文件格式(例如 Parquet 或 ORC)可以提高查询性能,因为 Redshift Spectrum 只读取查询所需的列,从而减少了数据扫描量。根据最常见的查询谓词对数据进行分区,可以使 Redshift Spectrum 仅扫描相关分区的数据,进一步减少扫描量并加快查询速度。将单个文件压缩到 1 GB 到 5 GB 之间的大小并使用 gzip 压缩是推荐的做法,但不是最快的查询性能的关键操作。将数据拆分为小于 10 KB 的文件会导致大量小文件,增加开销并降低性能。使用不可拆分的文件格式会限制并行处理能力,从而降低查询性能。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡