NexaVision sta valutando strategie distribuite per due carichi di lavoro: (A) l'addestramento di ResNet50 su ImageNet su 8 GPU p3.8xlarge, dove il modello completo si adatta facilmente a una singola GPU ma è necessaria una dimensione del batch effettiva maggiore, e (B) l'addestramento di un transformer da 100 miliardi di parametri dove una singola GPU non può contenere i pesi del modello. Per questi due distinti carichi di lavoro, scegli DUE opzioni che descrivono quale approccio distribuito di SageMaker è appropriato per ciascuno.
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Utilizzare SageMaker Distributed Data Parallel (SMDDP) per il carico di lavoro A perché il modello si adatta alla memoria di una singola GPU e si desidera replicare il modello e scalare la dimensione del batch e il throughput tra le GPU con NCCL/torch.distributed., Utilizzare Model Parallel (SageMaker Model Parallel / pipeline parallel) per il carico di lavoro B perché il transformer da 100 miliardi di parametri non può essere contenuto in una singola GPU e i parametri devono essere frammentati tra i dispositivi..
Perché questa è la risposta
Per il carico di lavoro A, il modello ResNet50 si adatta a una singola GPU. L'obiettivo è aumentare la dimensione del batch e il throughput. SageMaker Distributed Data Parallel (SMDDP) è la scelta appropriata perché replica il modello su ogni GPU e distribuisce i dati di input, consentendo un addestramento più rapido con batch più grandi. Utilizza NCCL/torch.distributed per una comunicazione efficiente. Per il carico di lavoro B, il modello transformer da 100 miliardi di parametri è troppo grande per una singola GPU. SageMaker Model Parallel (o pipeline parallel) è necessario in questo caso. Questo approccio frammenta il modello tra più GPU, permettendo di addestrare modelli che altrimenti non si adatterebbero alla memoria di una singola GPU. Le opzioni errate suggeriscono l'uso di Model Parallel per il carico di lavoro A (non necessario e meno efficiente per i modelli che si adattano a una singola GPU) o SMDDP per il carico di lavoro B (impossibile, poiché il modello non si adatta a una singola GPU per essere replicato). L'addestramento a nodo singolo non frammenta automaticamente i modelli grandi tra le GPU.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta