一位机器学习工程师必须构建一个管道,该管道使用 Amazon Athena 处理两种工作负载:用于大规模批处理转换和模型训练,以及用于推理和分析的近实时低延迟查询。哪种文件格式能为批处理和近实时处理提供最低的延迟?
选择一个答案
点击一个选项来检查您的答案。
正确答案: Apache Parquet.
为什么这是答案
Apache Parquet 是一种列式存储文件格式,它通过将数据按列存储来优化分析查询。这种格式在处理大规模批处理转换和模型训练时表现出色,因为它允许高效地读取特定列,减少了I/O操作。对于近实时低延迟查询,Parquet 的列式存储和数据压缩特性也能显著提高查询性能,因为它只读取查询所需的列数据。 CSV 是一种行式存储格式,不适合需要高效列读取的分析工作负载。Nested JSON 和 Deserialized JSON 都是基于文本的格式,通常比二进制的 Parquet 占用更多存储空间,并且在查询性能方面效率较低,尤其是在大规模数据集上。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡