A NexaVision está avaliando estratégias distribuídas para duas cargas de trabalho: (A) treinar o ResNet50 no ImageNet em 8 GPUs p3.8xlarge, onde o modelo completo se encaixa facilmente em uma única GPU, mas eles precisam de um tamanho de lote efetivo maior, e (B) treinar um transformador de 100 bilhões de parâmetros, onde uma única GPU não consegue conter os pesos do modelo. Para essas duas cargas de trabalho distintas, escolha DUAS opções que descrevam qual abordagem distribuída do SageMaker é apropriada para cada uma.
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Use SageMaker Distributed Data Parallel (SMDDP) para a carga de trabalho A porque o modelo se encaixa na memória de uma única GPU e você deseja replicar o modelo e escalar o tamanho do lote e o throughput entre GPUs com NCCL/torch.distributed., Use Model Parallel (SageMaker Model Parallel / pipeline parallel) para a carga de trabalho B porque o transformador de 100 bilhões de parâmetros não pode ser encaixado em uma única GPU e deve ter os parâmetros fragmentados entre os dispositivos..
Por que esta é a resposta
Para a carga de trabalho A, onde o modelo cabe em uma única GPU, mas é necessário um tamanho de lote maior e maior throughput, o SageMaker Distributed Data Parallel (SMDDP) é a escolha apropriada. O SMDDP replica o modelo em cada GPU e distribui os dados de treinamento, permitindo um tamanho de lote efetivo maior e aproveitando a comunicação eficiente via NCCL/torch.distributed para sincronização de gradientes. Para a carga de trabalho B, com um modelo de 100 bilhões de parâmetros que não cabe em uma única GPU, o SageMaker Model Parallel (também conhecido como pipeline parallel) é a solução correta. Essa abordagem fragmenta o modelo em partes menores, distribuindo-as por várias GPUs, permitindo o treinamento de modelos que excedem a memória de uma única GPU. As opções incorretas sugerem o uso de paralelismo de modelo para a carga de trabalho A (desnecessário e menos eficiente para esse cenário) ou paralelismo de dados para a carga de trabalho B (inviável, pois o modelo não cabe em uma única GPU para ser replicado). O treinamento de nó único não fragmenta automaticamente modelos grandes entre GPUs.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão