AmazonAmazon ML Engineer Associate MLA-C01 Certification
·CN
·更新于 4 Aug 2026
一位机器学习工程师需要处理存储在中央 S3 存储桶中的数千个现有 CSV 文件以及新的 CSV 上传。所有 CSV 文件共享相同的列布局,并包含一个必须查询的交易日期列。哪种解决方案能以最少的运营开销实现此目标?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 运行 Amazon Athena CREATE TABLE AS SELECT (CTAS) 以在 S3 数据上构建一个表(按交易日期分区或过滤),然后查询该表。.
为什么这是答案
正确答案是使用 Amazon Athena CTAS。Athena 是一种交互式查询服务,可以直接查询 S3 中的数据,无需加载或转换。CTAS 语句可以创建新表,同时对数据进行分区或过滤,例如按交易日期分区,这大大减少了查询时扫描的数据量,从而降低了成本并提高了性能。这种方法操作开销最低,因为它不需要管理额外的计算集群或数据复制流程。
其他选项的缺点:
将对象复制到新存储桶并使用 S3 Object Lambda 会增加数据复制和管理开销,并且 S3 Object Lambda 主要用于按需转换,而不是高效的批量查询。
运行 AWS Glue for Apache Spark 作业需要管理 Spark 集群,并且涉及数据转换和写入新存储桶,增加了计算和存储成本以及操作复杂性。
使用 Amazon Kinesis Data Firehose 结合 Lambda 函数主要用于实时数据流处理和转换,不适用于对现有大量静态 S3 数据的批量查询,并且会引入不必要的实时处理组件和相关开销。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡