一位专家在 S3 中拥有一个非常大的训练数据集(数百万条记录)。他们希望避免将所有数据复制到 SageMaker notebook 的 5 GB EBS 卷中,但仍能使用完整数据集进行训练。哪种工作流允许使用完整数据集进行训练,同时最大限度地减少本地复制?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 在 notebook 上使用一小部分数据来验证训练代码,然后启动一个 SageMaker 训练作业,该作业使用 Pipe 输入模式读取完整的 S3 数据集。.
为什么这是答案
此选项通过在 SageMaker notebook 中使用小部分数据进行代码验证,避免了将整个数据集复制到本地5GB EBS卷。然后,通过启动 SageMaker 训练作业并利用 Pipe 输入模式,可以直接从 S3 流式传输完整数据集,无需下载到训练实例的本地存储,从而高效地处理大规模数据。 其他选项的问题在于: 启动带有 Deep Learning AMI 的 EC2 实例,并将 S3 存储桶附加到该实例:虽然可以在 EC2 上训练,但“返回 SageMaker 训练完整数据集”的说法不明确,且直接在 EC2 上训练可能需要更多手动配置和管理。 使用 AWS Glue 在小样本上测试训练兼容性:AWS Glue 主要用于数据ETL,而不是直接用于测试训练代码兼容性。 在 notebook 中使用一小部分数据进行本地训练以验证代码,然后启动一个 EC2 Deep Learning 实例并附加 S3 以训练完整数据集:这仍然需要手动管理 EC2 实例,并且没有利用 SageMaker 训练作业的托管服务优势,也没有明确说明如何避免将整个数据集下载到 EC2 实例。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡