Специалист имеет очень большой обучающий набор данных в S3 (миллионы записей). Он хочет избежать копирования всех данных в 5 ГБ том EBS ноутбука SageMaker, но при этом обучать модель на полном наборе данных. Какой рабочий процесс позволяет использовать полный набор данных для обучения с минимальным локальным копированием?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Использовать небольшое подмножество данных на ноутбуке для проверки кода обучения, затем запустить задание обучения SageMaker, которое считывает полный набор данных S3, используя Pipe input mode..
Почему это правильный ответ
Правильный ответ предлагает наиболее эффективный и масштабируемый подход. Использование небольшого подмножества данных на ноутбуке SageMaker позволяет быстро итеративно проверять код обучения без необходимости загружать весь объем данных. Затем, для обучения на полном наборе данных, запускается задание обучения SageMaker, которое напрямую считывает данные из S3 в режиме Pipe. Режим Pipe (потоковый режим) позволяет модели получать данные по мере необходимости, не загружая весь набор данных на диск экземпляра обучения, что экономит место и время. Остальные варианты менее оптимальны: Запуск инстанса EC2 с Deep Learning AMI и подключение S3, а затем возврат в SageMaker, усложняет рабочий процесс и не использует преимущества SageMaker для масштабируемого обучения. Использование AWS Glue для тестирования совместимости данных не является основной целью для обучения модели и не решает проблему эффективного использования данных в SageMaker. Обучение на EC2 Deep Learning для полного набора данных после локального тестирования также усложняет процесс и не использует режим Pipe для оптимизации загрузки данных.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется