一家社交媒体公司将训练一个图像分类模型(使用 SageMaker 的内置图像分类器)来检测冒犯性内容。他们将使用管道模式(pipe mode)来加速训练。数据集被分成训练(Training)、验证(Validation)和测试(Test)文件夹,其中包含类别子文件夹,图像大小统一调整,并有两个名为 training.lst 和 validation.lst 的清单文件。他们为训练和验证上传创建了单独的 S3 存储桶。在上传到 S3 之前,他们还应该执行哪些额外的数据准备步骤?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用 Apache MXNet 的 im2rec 工具将清单转换为 RecordIO 文件(training.rec 和 validation.rec),然后将 RecordIO 文件上传到训练 S3 存储桶。.
为什么这是答案
正确答案是使用 Apache MXNet 的 im2rec 工具将清单转换为 RecordIO 文件,然后将 RecordIO 文件上传到训练 S3 存储桶。这是因为 SageMaker 内置图像分类器在管道模式下训练时,期望输入数据为 RecordIO 格式,以实现高效的数据流传输。im2rec 工具专门用于将图像数据和对应的清单文件转换为 RecordIO 格式。 将图像读入 Pandas DataFrame 并写入 Parquet 文件不适用于图像分类器,因为 Parquet 主要用于表格数据,且内置分类器不直接支持此格式。使用 Snappy 或 gzip 压缩训练和验证目录并上传压缩数据,虽然可以减少存储空间,但内置图像分类器在管道模式下仍然需要 RecordIO 格式的数据才能进行训练,压缩本身并不能替代格式转换。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡