一家公司将创建多个机器学习预测模型。训练数据存储在 Amazon S3 中,完整数据集大于 5 TB,包含 CSV、JSON、Parquet 和文本文件。数据必须经过几个顺序处理步骤,其中包括复杂的转换和一些自然语言处理 (NLP) 工作,这些工作可能需要数小时才能运行。整个过程必须自动化。哪种解决方案能满足这些需求?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 为处理步骤创建 Amazon SageMaker Pipelines 工作流,并使用 Amazon EventBridge 触发/自动化管道。.
为什么这是答案
Amazon SageMaker Pipelines 专为构建、管理和自动化机器学习工作流而设计,能够处理多步骤、复杂的转换和长时间运行的任务,非常适合本场景中处理多种文件格式(CSV、JSON、Parquet、文本文件)和大型数据集(5 TB)的需求。结合 Amazon EventBridge,可以轻松实现整个流程的自动化触发和调度。 其他选项的不足: Amazon SageMaker Data Wrangler 专注于数据准备和特征工程,虽然功能强大,但其主要设计目的不是编排端到端的多步骤复杂 ML 工作流,特别是包含 NLP 等长时间运行的任务时。 Amazon SageMaker notebooks 主要用于交互式开发和实验,不适合生产环境中的自动化和编排。 AWS Lambda 函数有执行时间限制(通常最长 15 分钟),不适合包含复杂转换和 NLP 等可能运行数小时的任务。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡