NexaVision está evaluando estrategias distribuidas para dos cargas de trabajo: (A) entrenar ResNet50 en ImageNet en 8 GPU p3.8xlarge donde el modelo completo cabe fácilmente en una sola GPU, pero necesitan un tamaño de lote efectivo mayor, y (B) entrenar un transformador de 100B parámetros donde una sola GPU no puede contener los pesos del modelo. Para estas dos cargas de trabajo distintas, elija DOS opciones que describan qué enfoque distribuido de SageMaker es apropiado para cada una.
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Utilice SageMaker Distributed Data Parallel (SMDDP) para la carga de trabajo A porque el modelo cabe en la memoria de una sola GPU y desea replicar el modelo y escalar el tamaño del lote y el rendimiento en las GPU con NCCL/torch.distributed., Utilice Model Parallel (SageMaker Model Parallel / pipeline parallel) para la carga de trabajo B porque el transformador de 100B parámetros no puede caber en una sola GPU y debe tener los parámetros fragmentados en los dispositivos..
Por qué esta es la respuesta
Para la carga de trabajo A, donde el modelo ResNet50 cabe en una sola GPU y se busca un mayor tamaño de lote efectivo, SageMaker Distributed Data Parallel (SMDDP) es la opción correcta. SMDDP replica el modelo en cada GPU y distribuye los datos de entrenamiento, lo que permite un escalado eficiente del tamaño del lote y el rendimiento utilizando NCCL/torch.distributed para la sincronización de gradientes. La opción incorrecta que sugiere Model Parallel para la carga de trabajo A es errónea porque SMDDP sí utiliza NCCL y es el enfoque adecuado para modelos que caben en una sola GPU. Para la carga de trabajo B, donde el modelo Transformer de 100B parámetros no cabe en una sola GPU, SageMaker Model Parallel (incluyendo pipeline parallel) es la opción correcta. Este enfoque divide el modelo en partes y las distribuye entre las GPU, permitiendo entrenar modelos que exceden la memoria de una sola GPU. La opción incorrecta que sugiere SMDDP para la carga de trabajo B es inviable, ya que replicar un modelo de 100B parámetros en cada GPU no es posible si no cabe en una sola. La opción de entrenamiento de nodo único es incorrecta porque SageMaker no fragmenta automáticamente modelos muy grandes sin configuración específica de paralelismo.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta