AmazonAmazon ML Engineer Associate MLA-C01 Certification
·TW
·更新於 4 Aug 2026
NexaVision 正在評估兩種工作負載的分散式策略:(A) 在 8 個 p3.8xlarge GPU 上使用 ImageNet 訓練 ResNet50,其中完整模型可以輕鬆地放入單一 GPU 中,但他們需要更高的有效批次大小;以及 (B) 訓練一個 100B 參數的 transformer,其中單一 GPU 無法容納模型權重。針對這兩種不同的工作負載,請選擇兩個選項來描述哪種 SageMaker 分散式方法適用於每個工作負載。
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 針對工作負載 A 使用 SageMaker Distributed Data Parallel (SMDDP),因為模型適合單一 GPU 記憶體,而且您希望透過 NCCL/torch.distributed 在 GPU 之間複製模型並擴展批次大小和吞吐量。, 針對工作負載 B 使用 Model Parallel (SageMaker Model Parallel / pipeline parallel),因為 100B 參數的 transformer 無法放入單一 GPU 中,並且必須將參數分片到多個裝置上。.
為什麼這是答案
工作負載 A 的模型(ResNet50)適合單一 GPU 記憶體,但需要更大的有效批次大小。SageMaker Distributed Data Parallel (SMDDP) 透過在多個 GPU 上複製模型並分散資料批次來實現此目的,利用 NCCL/torch.distributed 進行高效通訊,從而提高吞吐量。
工作負載 B 的模型(100B 參數的 transformer)無法放入單一 GPU。SageMaker Model Parallel (或 pipeline parallel) 專為此類情況設計,它將模型權重分割並分佈到多個 GPU 上,使訓練大型模型成為可能。
錯誤選項:
對於工作負載 A,Model Parallel 不適用,因為模型已適合單一 GPU,且 SMDDP 針對資料並行進行了優化,並非如選項所述無法使用 NCCL。
對於工作負載 B,SMDDP 不適用,因為模型無法複製到每個 GPU 上。
單節點訓練不適用於這兩種情況,因為它們都需要分散式策略來處理模型大小或批次大小需求。SageMaker 不會自動將大型模型分片而無需任何程式碼更改。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 →
無需信用卡