NexaVision ocenia rozproszone strategie dla dwóch obciążeń: (A) trenowanie ResNet50 na ImageNet na 8 procesorach graficznych p3.8xlarge, gdzie cały model z łatwością mieści się na jednym procesorze graficznym, ale potrzebna jest większa efektywna wielkość partii, oraz (B) trenowanie transformera o 100 miliardach parametrów, gdzie pojedynczy procesor graficzny nie jest w stanie pomieścić wag modelu. Dla tych dwóch różnych obciążeń wybierz DWIE opcje opisujące, które podejście rozproszone SageMaker jest odpowiednie dla każdego z nich.
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Użyj SageMaker Distributed Data Parallel (SMDDP) dla obciążenia A, ponieważ model mieści się w pamięci pojedynczego procesora graficznego, a chcesz replikować model i skalować rozmiar partii oraz przepustowość na wielu procesorach graficznych za pomocą NCCL/torch.distributed., Użyj Model Parallel (SageMaker Model Parallel / pipeline parallel) dla obciążenia B, ponieważ transformer o 100 miliardach parametrów nie mieści się w pojedynczym procesorze graficznym i musi mieć parametry rozdzielone na wiele urządzeń..
Dlaczego to jest odpowiedź
Dla obciążenia A, gdzie model mieści się na jednym GPU, ale potrzebna jest większa efektywna wielkość partii, SageMaker Distributed Data Parallel (SMDDP) jest idealny. SMDDP replikuje model na wielu GPU i rozdziela dane treningowe, co pozwala na skalowanie wielkości partii i przepustowości. Wykorzystuje NCCL/torch.distributed do wydajnej komunikacji między GPU. Dla obciążenia B, gdzie model (100 miliardów parametrów) jest zbyt duży, aby zmieścić się na pojedynczym GPU, Model Parallel (SageMaker Model Parallel / pipeline parallel) jest właściwym wyborem. Model Parallel dzieli parametry modelu na wiele urządzeń, umożliwiając trenowanie bardzo dużych modeli, które w przeciwnym razie przekroczyłyby pamięć pojedynczego GPU. Pozostałe opcje są nieprawidłowe: Użycie SageMaker MP dla obciążenia A jest niepotrzebne, ponieważ model mieści się na jednym GPU, a SMDDP jest bardziej efektywny dla równoległości danych. Użycie SMDDP dla obciążenia B jest niewykonalne, ponieważ model nie zmieści się na pojedynczym GPU, co uniemożliwia replikację całego modelu. Trening na jednym węźle dla obu obciążeń nie wykorzysta w pełni dostępnych zasobów i nie rozwiąże problemu zbyt dużego modelu w obciążeniu B.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana