Amazon MLS-C01: MLOps, мониторинг, разметка данных и управление моделями — Руководство по подготовке

Часть AWS Machine Learning Specialty MLS-C01 — Руководство по подготовке. Практикуйтесь с проверенными ответами в центре экзаменов Amazon, или пройдите тесты на время на ExamRoll.io.

Конвейеры, CI/CD и автоматизация

Промышленное машинное обучение (ML) требует сквозной автоматизации, которая связывает сбор данных, валидацию, обучение, настройку, упаковку модели и развертывание в повторяемые конвейеры. Используйте Amazon SageMaker Pipelines для определения шагов для заданий обработки (Processing jobs) (Data Wrangler или ScriptProcessor), обучения (управляемое обучение с помощью Distributed Data Parallel или XGBoost/BlazingText), настройки гиперпараметров (HyperparameterTuningJob с целевой метрикой и StoppingCondition для задания обучения) и регистрации моделей в SageMaker Model Registry. Интегрируйте Pipelines с AWS CodePipeline и CodeBuild для проверок CI на уровне кода и юнит-тестов, а также используйте CloudFormation или CDK для предоставления согласованных сред. Настройте кэширование на шагах, чтобы избежать повторного выполнения неизмененной работы, и параметризуйте входные данные конвейера (префиксы S3, типы инстансов). Для HPO (настройки гиперпараметров) не полагайтесь только на MaxNumberOfTrainingJobs; также устанавливайте StoppingCondition для каждого задания обучения (например, MaxRuntimeInSeconds) и включайте автоматическую раннюю остановку, где это возможно, чтобы избежать неконтролируемого роста затрат. Распространенные ошибки включают использование режима File mode для постоянно растущих наборов данных (переключайтесь на Pipe mode или распределенное обучение для больших датасетов), отказ от версионирования наборов данных и признаков, а также отсутствие этапов проверки данных (SageMaker Processing + Deequ или проверки Data Wrangler) перед переобучением. Критерии выбора между моделями внутри базы данных (Redshift ML) и SageMaker основаны на сложности модели, задержке и операционном контроле: Redshift ML удобен для простых моделей XGBoost внутри SQL, в то время как SageMaker необходим для глубоких нейронных сетей, пользовательских архитектур и масштабируемых эндпоинтов.

Мониторинг, обнаружение дрейфа и качество модели

Непрерывный мониторинг должен охватывать как производительность модели, так и качество данных. Включите сбор данных (data capture) на эндпоинтах моделей SageMaker для сохранения запросов и ответов в S3, затем создайте базовый профиль (baseline) для обучающего распределения с помощью задания SageMaker Model Monitor. Используйте встроенные проверки Model Monitor для выявления нарушений схемы и одномерных метрик дрейфа; для сдвигов распределения вычисляйте KL-дивергенцию, Population Stability Index (PSI) или KS-тесты и устанавливайте оповещения CloudWatch по пороговым значениям дрейфа. Отслеживайте метрики модели — для классификации: точность/полнота (precision/recall), ROC AUC, матрица ошибок и специфичные для класса FPR/FNR; для регрессии: RMSE, MAE и MAPE. Clarify может выполнять проверки на смещение (bias) и объяснимость (explainability) на этапах до и после обучения и генерировать оценки важности признаков на основе SHAP; используйте Clarify для выявления расхождений в производительности для подгрупп (по чувствительным атрибутам). Распространенные операционные ошибки включают отсутствие сбора контекста инференса (сопоставление признаков, версия модели, ID запроса), игнорирование задержки в получении меток (запоздалые метки нарушают своевременную оценку) и смешивание сдвига популяции с дрейфом концепции — с ними нужно работать по-разному (переобучение против сбора меток и переоценки признаков). Для оповещений отправляйте агрегированные метрики и индикаторы дрейфа в CloudWatch и автоматизируйте откат или переобучение через SageMaker Pipelines при превышении пороговых значений.

Разметка, подготовка данных и инжиниринг признаков

Качественные метки и согласованные конвейеры признаков являются основополагающими. Используйте Amazon SageMaker Ground Truth для создания рабочих процессов разметки с автоматической предварительной разметкой (разметка с помощью модели), активным обучением и консолидацией аннотаций; выбирайте типы исполнителей (частная рабочая сила, поставщик или публичная) и настраивайте проверку меток и метрики межэкспертного согласия. Для исследовательского анализа данных (EDA) и преобразований загружайте наборы данных в SageMaker Data Wrangler, чтобы профилировать распределения, заполнять пропущенные значения и экспортировать скрипты обработки в задания SageMaker Processing. Сохраняйте онлайн- и офлайн-признаки в Amazon SageMaker Feature Store для согласованного получения в реальном времени и простого обратного заполнения (backfill). Решения о кодировании зависят от масштаба и кардинальности: категориальные признаки с низкой кардинальностью можно кодировать методом one-hot; для элементов с высокой кардинальностью (например, 100 артикулов товаров) используется целевое кодирование (target encoding) или эмбеддинги (слои эмбеддингов TensorFlow/PyTorch или встроенные алгоритмы SageMaker), а ответы с множественным выбором в опросах преобразуются в multi-hot векторы. Остерегайтесь распространенных ошибок, таких как утечка меток при добавлении ежедневных метаданных (включайте окна для инжиниринга признаков и тесты на утечку), использование режима File mode для очень больших наборов данных в S3 (режим Pipe mode передает записи потоком и поддерживает распределенное обучение на нескольких инстансах) и отказ от версионирования преобразований — экспортируйте преобразования из Data Wrangler в повторно используемые шаги Processing/Training, чтобы обеспечить паритет между обучением и инференсом.

Объяснимость, управление и масштабирование ML-команд

Для объяснимости и управления требуются практические артефакты и журналы аудита. Используйте SageMaker Clarify для вычисления метрик смещения перед обучением и атрибуции признаков после обучения (SHAP), а также для сохранения результатов в записях Model Registry. Регистрируйте модели в SageMaker Model Registry со статусами утверждения, подписанными ModelPackageGroups и автоматизированными шлюзами для продвижения. Отслеживайте эксперименты и происхождение данных (lineage) с помощью SageMaker Experiments и включите CloudTrail для аудита вызовов API. Для техник объяснимости предпочитайте встроенную в модель важность признаков для древовидных моделей (встроенный SHAP в XGBoost) и используйте SHAP или интегрированные градиенты для глубоких сетей, помня о затратах на выполнение — предварительно вычисляйте объяснения в офлайн-режиме для пакетной обработки и предоставляйте сводки для запросов в реальном времени. Лучшие практики управления включают карточки моделей (model cards) с описаниями наборов данных, проверками на справедливость (fairness) и документированными бизнес-правилами, а также применение принципа наименьших привилегий IAM при развертывании моделей. Для масштабирования команд используйте модульные конвейеры, создавайте стандартные шаблоны для предварительной обработки/валидации, централизуйте Feature Store и автоматизируйте обнаружение дрейфа и триггеры переобучения, чтобы специалисты по данным могли сосредоточиться на улучшениях, а не на операционной деятельности. Распространенные ошибки включают чрезмерную опору на важность признаков для определения причинно-следственных связей, отсутствие ведения журналов аудита для развернутых моделей и синхронное выполнение ресурсоемких вычислений объяснимости в конечных точках с низкой задержкой.

Практическая задача: сценарий использования

Сценарий: Компания Acme Manufacturing управляет парком удаленных датчиков с прерывистым подключением к сети и использует AWS IoT и S3 для централизованного сбора данных. Их ML-среда в AWS включает SageMaker, IoT Core, Kinesis Data Streams и периферийные устройства с поддержкой Greengrass.

Задача: Обеспечить обнаружение аномалий с низкой задержкой на удаленных объектах при прерывистом подключении, одновременно собирая телеметрию для централизованного переобучения и обнаружения дрейфа без использования Direct Connect.

Рекомендуемый подход:

  1. Разверните компактную модель обнаружения аномалий, скомпилированную с помощью SageMaker Neo, в AWS IoT Greengrass на периферийных устройствах для локального инференса в реальном времени и выполнения действий (локальные оповещения, краткосрочная буферизация).
  2. Передавайте обобщенную телеметрию и флаги аномалий через AWS IoT Core в Amazon Kinesis Data Streams и используйте Kinesis Data Firehose для сохранения необработанных и агрегированных данных в S3 (в формате parquet) для централизованного хранения.
  3. Создайте конвейер SageMaker Pipeline, который принимает пакеты данных из S3, запускает задания обработки (Processing jobs) с помощью Data Wrangler для вычисления базовых показателей и инжиниринга признаков, при необходимости запускает HyperparameterTuningJobs и регистрирует проверенные модели в SageMaker Model Registry.
  4. Включите SageMaker Model Monitor на центральной конечной точке и запланируйте пакетные задания, которые сравнивают распределения, собранные на периферийных устройствах, с базовыми показателями обучения (PSI/KL), и используйте SageMaker Ground Truth с выборкой оповещений для разметки людьми, чтобы замкнуть цикл обратной связи.

Обоснование: Инференс на периферии с помощью Greengrass и Neo обеспечивает принятие решений с низкой задержкой при прерывистом подключении; Kinesis и Firehose гарантируют надежную, упорядоченную загрузку данных в S3 для переобучения; SageMaker Pipelines и Model Registry обеспечивают повторяемое переобучение, версионирование и автоматическое продвижение моделей с проверками на дрейф для поддержания их качества.


Безопасность · Все домены

Отработать эти вопросы → · Тесты на время на ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Сдайте экзамен →

Просмотреть Amazon →

Related guides

Все включено

Одна подписка. Каждый экзамен.

Каждый план открывает неограниченный поиск ответов, практические тесты, объяснения AI и полную библиотеку ресурсов — на более чем 20 языках.

Ежемесячно
24.87
Just €0.83/day
Все включено:
  • Неограниченный поиск ответов
  • Неограниченные практические тесты
  • Объяснения на основе AI
  • Полная библиотека ресурсов
  • 20+ языков
  • Еженедельные обновления контента
  • Награды и рефералы
  • Приоритетная поддержка
Начать бесплатную пробную версию

Кредитная карта не требуется*

Лучшая цена
12 месяцев
179.87
Just €0.49/daySave 40%
Все включено:
  • Неограниченный поиск ответов
  • Неограниченные практические тесты
  • Объяснения на основе AI
  • Полная библиотека ресурсов
  • 20+ языков
  • Еженедельные обновления контента
  • Награды и рефералы
  • Приоритетная поддержка
Начать бесплатную пробную версию

Кредитная карта не требуется*

✓ Включен бесплатный план · ✓ Отмена в любое время · ✓ Все планы открывают полный продукт