Компания, работающая в сфере социальных сетей, будет обучать модель классификации изображений (используя встроенный классификатор изображений SageMaker) для обнаружения неприемлемого контента. Они будут использовать режим pipe mode для ускорения обучения. Набор данных разделён на папки Training, Validation и Test с подпапками классов, изображения имеют одинаковый размер, и есть два файла манифеста с именами training.lst и validation.lst. Они создали отдельные бакеты S3 для загрузки обучающих и валидационных данных. Какой дополнительный шаг подготовки данных им следует выполнить перед загрузкой в S3?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Преобразовать манифесты в файлы RecordIO (training.rec и validation.rec) с помощью утилиты im2rec из Apache MXNet, затем загрузить файлы RecordIO в бакет S3 для обучения..
Почему это правильный ответ
Правильный ответ — преобразование манифестов в файлы RecordIO с помощью утилиты im2rec из Apache MXNet. Встроенный алгоритм классификации изображений Amazon SageMaker ожидает данные в формате RecordIO при использовании режима pipe mode. Это позволяет алгоритму напрямую считывать данные из S3, избегая необходимости загрузки всего набора данных в экземпляр обучения, что значительно ускоряет процесс. Остальные варианты неверны, потому что: Считывание изображений в Pandas DataFrame и запись в Parquet не является форматом, ожидаемым встроенным классификатором изображений SageMaker для pipe mode. Сжатие каталогов с помощью Snappy или gzip не преобразует данные в требуемый формат RecordIO. Хотя сжатие может уменьшить размер данных, оно не решает проблему совместимости формата для pipe mode.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется