NexaVision оценивает распределенные стратегии для двух рабочих нагрузок: (A) обучение ResNet50 на ImageNet с использованием 8 x p3.8xlarge GPU, где полная модель легко помещается на одном GPU, но требуется более высокий эффективный размер пакета, и (B) обучение трансформера с 100 миллиардами параметров, где один GPU не может вместить веса модели. Для этих двух различных рабочих нагрузок выберите ДВА варианта, описывающих, какой распределенный подход SageMaker подходит для каждой.
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Используйте SageMaker Distributed Data Parallel (SMDDP) для рабочей нагрузки A, потому что модель помещается в память одного GPU, и вы хотите реплицировать модель и масштабировать размер пакета и пропускную способность на нескольких GPU с помощью NCCL/torch.distributed., Используйте Model Parallel (SageMaker Model Parallel / pipeline parallel) для рабочей нагрузки B, потому что трансформер с 100 миллиардами параметров не может поместиться в один GPU и его параметры должны быть разделены между устройствами..
Почему это правильный ответ
Для рабочей нагрузки A, где модель ResNet50 помещается в один GPU, но требуется больший эффективный размер пакета, SageMaker Distributed Data Parallel (SMDDP) является правильным выбором. SMDDP реплицирует модель на нескольких GPU и распределяет данные, позволяя масштабировать размер пакета и пропускную способность за счет параллельной обработки на каждом GPU, используя NCCL/torch.distributed для эффективной синхронизации градиентов. Использование SageMaker Model Parallel для рабочей нагрузки A неверно, так как модель помещается в один GPU, и параллелизм данных более эффективен для увеличения пропускной способности. Для рабочей нагрузки B, где трансформер с 100 миллиардами параметров не помещается в один GPU, SageMaker Model Parallel (включая pipeline/model-parallel библиотеки) является правильным выбором. Этот подход разделяет модель (ее слои или параметры) между несколькими GPU, позволяя обучать очень большие модели, которые не могут быть размещены на одном устройстве. Использование SMDDP для рабочей нагрузки B неверно, так как репликация всей 100-миллиардной модели на каждом GPU невозможна из-за ограничений памяти. Обучение на одном узле не подходит для обеих рабочих нагрузок, так как оно не масштабируется для больших моделей или высоких требований к пропускной способности, и SageMaker не разделяет модели автоматически без явной конфигурации.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется