AmazonAmazon ML Engineer Associate MLA-C01 Certification
·CN
·更新于 4 Aug 2026
NexaVision 正在评估两种工作负载的分布式策略:(A) 在 8 x p3.8xlarge GPU 上使用 ImageNet 训练 ResNet50,其中完整模型可以轻松地放入单个 GPU,但他们需要更高的有效批处理大小;(B) 训练一个 100B 参数的 transformer,其中单个 GPU 无法容纳模型权重。对于这两种不同的工作负载,请选择两个选项来描述哪种 SageMaker 分布式方法适合每种情况。
选择一个答案
点击一个选项来检查您的答案。
正确答案: 对工作负载 A 使用 SageMaker Distributed Data Parallel (SMDDP),因为模型适合单个 GPU 内存,并且您希望通过 NCCL/torch.distributed 在 GPU 之间复制模型并扩展批处理大小和吞吐量。, 对工作负载 B 使用 Model Parallel (SageMaker Model Parallel / pipeline parallel),因为 100B 参数的 transformer 无法放入单个 GPU,并且必须将参数分片到不同设备上。.
为什么这是答案
对于工作负载 A,模型 ResNet50 可以放入单个 GPU 内存,但需要更大的有效批处理大小以提高训练效率。SageMaker Distributed Data Parallel (SMDDP) 是理想选择,因为它通过在多个 GPU 上复制模型并并行处理数据批次来扩展吞吐量,利用 NCCL 进行高效通信。
对于工作负载 B,一个 100B 参数的 transformer 模型无法单独放入单个 GPU。因此,必须使用 SageMaker Model Parallel (SageMaker MP / pipeline/model-parallel libraries) 将模型权重分片到多个 GPU 上。数据并行(如 SMDDP)不适用,因为它要求模型能放入单个 GPU。单节点训练不适合这两种分布式工作负载。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡