AmazonAmazon ML Engineer Associate MLA-C01 Certification
·CN
·更新于 4 Aug 2026
StreamVid 在 S3 中维护着数 TB 的原始 CSV 日志,并且在训练之前需要自动化的数据分析和可重复的转换(解析时间戳、删除低基数列、转换为 Parquet)。哪种 DataBrew 工作流最能满足这些要求,以及如何确保计划运行?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 创建一个指向 S3 路径的 DataBrew 数据集,运行一个分析作业来生成统计信息,编写一个包含所需步骤(解析时间戳、删除列、转换为 Parquet)的配方,然后创建一个将 Parquet 输出写回 S3 的 DataBrew 作业。计划 DataBrew 作业并确保作业角色具有 S3 读/写权限,并且数据集路径可从作业的 VPC(如果指定)访问。.
为什么这是答案
此选项是正确的,因为它完全符合 StreamVid 的需求。DataBrew 旨在处理 S3 中的原始数据,提供数据分析功能(通过分析作业),支持数据转换(通过配方,包括解析时间戳、删除列和转换为 Parquet),并且能够将处理后的数据写回 S3。DataBrew 作业可以按计划运行,并且通过 IAM 角色管理 S3 访问是标准且安全的实践。
其他选项不正确的原因:
AWS Glue ETL 也可以完成任务,但 DataBrew 更专注于无代码或低代码的数据准备,并且可以生成 Parquet。DataBrew 确实可以计划定期作业并输出 Parquet。使用 IAM 用户凭证而不是角色是不推荐的安全实践。
SageMaker Data Wrangler 适用于数据准备,但 DataBrew 是更直接、更集成的解决方案,可以生成 Parquet 并计划运行。
Lambda 函数虽然可以实现,但对于 TB 级别的数据处理,它通常不是最经济或最可扩展的解决方案,并且需要更多的自定义编码,与 DataBrew 的无服务器、托管式服务理念不符。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡