一位数据工程师需要一次性读取 S3 存储桶中的 Apache Parquet 对象并仅提取单个列。哪种方案能以最少的操作开销实现此目的?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用 S3 Select 编写 SQL SELECT 语句,从 S3 对象中检索所需的列。.
为什么这是答案
正确答案是使用 S3 Select 编写 SQL SELECT 语句,从 S3 对象中检索所需的列。S3 Select 允许您直接对存储在 S3 中的对象运行 SQL 查询,从而只检索您需要的数据子集。这显著减少了从 S3 传输的数据量,从而降低了操作开销和成本。 其他选项效率较低: 配置 AWS Lambda 函数并加载到 pandas 数据帧中会涉及将整个 Parquet 对象加载到内存中,即使只需要一列。这会增加计算和内存开销。 准备 AWS Glue DataBrew 项目虽然功能强大,但对于仅提取单个列的简单任务来说,通常涉及更多的设置和处理步骤,操作开销更高。 在 S3 对象上运行 AWS Glue crawler 并在 Amazon Athena 中查询是处理结构化数据(如 Parquet)的常见方法,但对于仅提取单个列的“一次性”任务,它需要先运行 crawler 创建元数据,然后才能查询。S3 Select 提供了更直接、开销更小的方式来完成此特定任务。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡