Amazon MLS-C01: Глубокое обучение и компьютерное зрение — Руководство по подготовке

Часть AWS Machine Learning Specialty MLS-C01 — Руководство по подготовке. Практикуйтесь с проверенными ответами в центре экзаменов Amazon, или пройдите тесты на время на ExamRoll.io.

Архитектуры, трансферное обучение и выбор модели

Сверточные базовые архитектуры (backbones), такие как семейства ResNet и Inception, остаются рабочими лошадками в области компьютерного зрения: ResNet (50/101) предлагает стабильное остаточное обучение (residual learning) для глубоких иерархий признаков, в то время как модули Inception обеспечивают агрегацию признаков на нескольких масштабах, что помогает при работе с объектами разных размеров. Для современных компромиссов EfficientNet и MobileNet отдают приоритет соотношению FLOPs к точности, что делает их отличным выбором для мобильных/периферийных (edge) устройств. На практике в AWS начинайте с предобученных на ImageNet весов (доступных в TorchVision, TensorFlow Hub или через обучающие контейнеры SageMaker) и применяйте трансферное обучение, заменяя классификационную голову (classification head), используя значительно более низкую скорость обучения (learning rate) для слоев базовой архитектуры и более высокую для новых инициализированных голов. Замораживайте ранние слои для небольших наборов данных и постепенно размораживайте их поэтапно, чтобы избежать катастрофического забывания (catastrophic forgetting). Критерии выбора: выбирайте более тяжелые базовые архитектуры (ResNet101, Inception-ResNet) для больших наборов данных и эндпоинтов, нечувствительных к задержкам (инстансы ml.p3 или ml.p4), и легковесные (MobileNetV3, EfficientNet-lite) при развертывании на устройства с ограниченными ресурсами через SageMaker Neo или AWS IoT Greengrass. Распространенная ошибка — дообучение (fine-tuning) с той же высокой скоростью обучения, что и при обучении с нуля; вместо этого используйте дифференцированные скорости обучения (discriminative learning rates), применяйте регуляризацию весов (weight decay) и проверяйте переносимость, отслеживая активации слоев в пространстве признаков и потери на валидационном наборе (validation loss) на предмет признаков переобучения.

Практики обучения, аугментация и аспекты работы с наборами данных/разметкой

Высококачественные размеченные данные — это основа для надежных моделей компьютерного зрения. Используйте Amazon SageMaker Ground Truth для создания процессов разметки с помощью ограничивающих рамок (bounding boxes), полигонов или семантических масок, а также для обеспечения контроля доступа к данным за счет использования частных рабочих групп (private workforces), ограничений IAM и шифрования S3 с помощью KMS. Снижайте шум в разметке (label noise) с помощью раундов согласования (consensus) и проверки, а также используйте активное обучение (active learning) для приоритизации неоднозначных или редких примеров. Для небольших или несбалансированных наборов данных применяйте агрессивную, соответствующую задаче аугментацию: фотометрические преобразования, случайные обрезки (random crops), повороты, cutout, аугментации mixup или mosaic для детекции; используйте сбалансированную по классам выборку (class-balanced sampling), focal loss или взвешенную по классам кросс-энтропию (class-weighted cross-entropy) для борьбы с сильным дисбалансом классов. Разделяйте данные, чтобы избежать утечек (leakage): при наличии зависимостей на уровне пользователей или магазинов выполняйте групповое или временное разделение вместо наивного случайного; частая ошибка — утечка будущих временных меток или нескольких изображений одного и того же объекта между обучающей, валидационной и тестовой выборками (train/val/test). Для медицинских или регулируемых данных включайте сетевую изоляцию для заданий обучения SageMaker, шифруйте S3 с помощью KMS, ограничивайте доступ к ноутбукам через эндпоинты VPC и ротируйте учетные данные с помощью Secrets Manager. Отслеживайте эксперименты и метрики с помощью SageMaker Experiments, чтобы сопоставлять выбор аугментации, скоростей обучения и методов регуляризации с результатами.

Детекция и сегментация объектов: архитектуры, метрики и подводные камни

Выбор для детекции объектов включает одностадийные детекторы, такие как YOLO и RetinaNet, для пропускной способности в реальном времени, и двухстадийные детекторы, такие как Faster R-CNN, для более высокой точности и локализации мелких объектов. Добавляйте Feature Pyramid Networks (FPN) для улучшения многомасштабной детекции; используйте Mask R-CNN или DeepLabv3+ для задач сегментации экземпляров (instance segmentation) и семантической сегментации. Якоря (anchors), пороги IoU и подавление немаксимумов (Non-Max Suppression, NMS) сильно влияют на результаты: настраивайте размеры/соотношения сторон якорей в соответствии с масштабами объектов в наборе данных и выбирайте подходящий IoU для назначения положительных/отрицательных примеров. Оценка должна использовать mAP на разных уровнях IoU (AP50, AP75), а также кривые полноты/точности (recall/precision) для каждого класса — опора исключительно на точность (accuracy) скрывает ошибки локализации. В рабочих процессах AWS используйте обучение в SageMaker с контейнерами PyTorch/TensorFlow для пользовательских архитектур, храните наборы данных в S3 с файлами-манифестами для Ground Truth и выполняйте валидацию с помощью заданий SageMaker Processing. Распространенные ошибки — использование слишком большого размера входных данных для инференса (что увеличивает задержку) или игнорирование дисбаланса классов в количестве объектов; оптимизируйте, применяя аугментацию для конкретных классов, используя взвешенные функции потерь или двухэтапное обучение, где за универсальным детектором следует уточнитель (refiner) для каждого класса. Для использования в продакшене экспортируйте модели в формат ONNX или TorchScript и сверяйте выходные данные экспортированной модели с выходными данными при обучении, чтобы избежать несоответствия операторов.

Оптимизация, развертывание и мониторинг инференса для GPU и периферийных устройств

Оптимизация инференса требует профилирования всего конвейера, а не только вычислений на GPU. Низкая утилизация GPU часто вызвана препроцессингом, ограниченным мощностью CPU, малыми размерами батчей, задержками синхронных эндпоинтов или ожиданиями ввода-вывода. Профилируйте с помощью SageMaker Debugger и метрик CloudWatch для выявления узких мест, а затем применяйте решения: увеличьте размер батча или используйте асинхронный инференс; преобразуйте модели в TorchScript/ONNX и включите оптимизации TensorRT на инстансах с GPU от NVIDIA; используйте смешанную точность (AMP/bfloat16) на инстансах p4/p3; компилируйте с помощью SageMaker Neo для целевого оборудования или развертывайте Elastic Inference для добавления частичного ускорения к CPU-инстансам для умеренной пропускной способности. Для развертывания на периферийных устройствах используйте SageMaker Edge Manager или AWS IoT Greengrass с моделями, скомпилированными Neo, применяйте квантование и прунинг для уменьшения размера модели и выполняйте батчинг на самом устройстве, где это возможно. Настройте мультимодельные эндпоинты SageMaker или provisioned concurrency для обработки холодных стартов и используйте политики автоматического масштабирования на основе утилизации памяти GPU и задержки запросов. Также включите Model Monitor для обнаружения смещения входных данных и SageMaker Model Registry для контролируемого продвижения моделей; распространенные ошибки включают компиляцию моделей с неподдерживаемыми операциями для Neo или отсутствие настроенных IAM-ролей и VPC-эндпоинтов для частного доступа к S3, что приводит к сбоям развертывания.

Практическая задача: Сценарий использования

Сценарий: Компания QuickServe Corp использует локальную систему кассовых терминалов и применяет SageMaker для обучения и инференса моделей; изображения с камер магазинов хранятся в частном бакете S3 с шифрованием KMS. Они хотят создать производственный конвейер для определения длины очереди у касс и развернуть легковесную модель на периферийных устройствах для оповещений в реальном времени.

Задача: Создать и развернуть точную модель для подсчета людей в очереди с низкой задержкой, которая соблюдает требования безопасности данных (частный S3, KMS) и работает на ограниченном оборудовании периферийных устройств, обеспечивая при этом возможность безопасного переобучения на новых размеченных данных.

Рекомендуемый подход:

  1. Обучить детектор, используя предобученную архитектуру MobileNetV3 (в контейнере SageMaker PyTorch), дообученную на ограничивающих рамках (bounding boxes), размеченных с помощью Ground Truth и хранящихся в зашифрованном KMS бакете S3; использовать сгруппированные по магазинам выборки для предотвращения утечки данных.
  2. Использовать аугментацию (случайная обрезка, горизонтальное отражение, дрожание яркости) и focal loss для борьбы с дисбалансом классов между кадрами с очередью и без нее; валидировать с помощью метрик AP50 и полноты (recall) для каждого класса.
  3. Экспортировать модель в TorchScript/ONNX, скомпилировать с помощью SageMaker Neo для целевого периферийного устройства и развернуть через AWS IoT Greengrass или SageMaker Edge Manager с подписью модели и IAM-ролью, разрешающей доступ только к необходимым артефактам S3.
  4. Мониторить производительность с помощью периодических батчевых загрузок в S3, запускать задания SageMaker Processing для обнаружения смещения данных и переобучать в SageMaker, используя версионированные наборы данных в S3 и Model Registry с контролируемым выкатом на периферийные устройства.

Обоснование: Этот подход использует эффективное трансферное обучение и компиляцию под конкретное устройство для соблюдения требований к задержке и размеру, обеспечивает безопасность через KMS и IAM и реализует контур переобучения с мониторингом для поддержания точности, предотвращая при этом утечку данных.


Моделирование — с учителем и без учителя (классическое ML) · Все домены · Обработка естественного языка и речи

Отработать эти вопросы → · Тесты на время на ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Сдайте экзамен →

Просмотреть Amazon →

Related guides

Все включено

Одна подписка. Каждый экзамен.

Каждый план открывает неограниченный поиск ответов, практические тесты, объяснения AI и полную библиотеку ресурсов — на более чем 20 языках.

Ежемесячно
24.87
Just €0.83/day
Все включено:
  • Неограниченный поиск ответов
  • Неограниченные практические тесты
  • Объяснения на основе AI
  • Полная библиотека ресурсов
  • 20+ языков
  • Еженедельные обновления контента
  • Награды и рефералы
  • Приоритетная поддержка
Начать бесплатную пробную версию

Кредитная карта не требуется*

Лучшая цена
12 месяцев
179.87
Just €0.49/daySave 40%
Все включено:
  • Неограниченный поиск ответов
  • Неограниченные практические тесты
  • Объяснения на основе AI
  • Полная библиотека ресурсов
  • 20+ языков
  • Еженедельные обновления контента
  • Награды и рефералы
  • Приоритетная поддержка
Начать бесплатную пробную версию

Кредитная карта не требуется*

✓ Включен бесплатный план · ✓ Отмена в любое время · ✓ Все планы открывают полный продукт