一家公司正在使用存储在 S3 中的 200 TB 数据在 SageMaker 中训练模型。数据集包含许多文件,每个文件都大于 200 MB。该公司希望以最快的处理时间完成,并以最少的设置工作量。他们应该使用哪种数据访问方法?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用 SageMaker FastFile 模式按需从 S3 流式传输文件。.
为什么这是答案
SageMaker FastFile 模式(现在称为 SageMaker 的“直接 S3 访问”或“S3 模式”)允许训练作业直接从 S3 流式传输数据,而无需先下载整个数据集。这对于大型数据集(200 TB)和大型文件(大于 200 MB)特别有效,因为它减少了启动时间和存储开销,并优化了处理时间,同时最大限度地减少了设置工作。 使用 SageMaker File 模式会将整个 200 TB 数据集复制到训练实例存储,这会非常耗时且可能超出实例存储容量。创建 Amazon FSx for Lustre 文件系统并将其链接到 S3 存储桶虽然能提供高性能,但涉及额外的设置和管理工作,不符合“最少的设置工作量”要求。创建 Amazon EFS 文件系统并将其挂载到训练实例上,其性能通常低于 FSx for Lustre,并且对于 200 TB 的数据集来说,其吞吐量可能不足以实现最快的处理时间。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡