Amazon MLS-C01: Моделирование — с учителем и без учителя (классическое ML) — Руководство по подготовке
Часть AWS Machine Learning Specialty MLS-C01 — Руководство по подготовке. Практикуйтесь с проверенными ответами в центре экзаменов Amazon, или пройдите тесты на время на ExamRoll.io.
Выбор и архитектура модели для задач с учителем
Выбор модели начинается с анализа структуры данных и производственных ограничений. Для линейного сигнала с большим количеством примеров и интерпретируемыми коэффициентами регуляризованная линейная или логистическая регрессия (SageMaker LinearLearner или ElasticNet из scikit-learn) работает быстро и дает коэффициенты, которые можно проанализировать. Когда преобладают нелинейные взаимодействия, ансамбли деревьев, такие как XGBoost (контейнер SageMaker XGBoost) или LightGBM, улавливают гетерогенность без необходимости серьезного масштабирования признаков; настройте eta (learning_rate), max_depth, subsample, colsample_bytree и регуляризацию alpha/lambda для контроля переобучения. SVM могут быть эффективны на наборах признаков малого и среднего размера с хорошим масштабированием, но обычно требуют пользовательских контейнеров или ScriptMode в scikit-learn на SageMaker, поскольку работа с большими наборами данных обходится дорого; не забывайте стандартизировать признаки и тщательно выбирать ядро/регуляризацию (C, gamma). Naive Bayes — это быстрый базовый вариант для разреженных категориальных/текстовых данных высокой размерности; он предполагает условную независимость и плохо работает при сильных корреляциях. Для тысяч признаков или очень больших наборов данных используйте понижение размерности (PCA) или хэширование признаков и отдавайте предпочтение распределенному обучению на инстансах ml.c5 или ml.p3, если используете глубокие нейронные сети на GPU. Выполняйте развертывание с помощью эндпоинтов SageMaker для инференса в реальном времени или Batch Transform для пакетных предсказаний; используйте Multi-Model Endpoints при поддержке множества моделей для сокращения затрат.
Метрики, дисбаланс, калибровка и компромиссы при развертывании
Точность (Accuracy) — привлекательная, но вводящая в заблуждение метрика для несбалансированных задач; отдавайте предпочтение метрикам, чувствительным к классам, таким как precision, recall, F1, ROC AUC для акцента на сбалансированности классов, и PR AUC, когда положительный класс встречается редко. При получении вероятностей проверяйте калибровку с помощью диаграмм надежности и Brier score; используйте масштабирование Платта или изотоническую калибровку, реализованную офлайн (CalibratedClassifierCV в scikit-learn), или выполняйте калибровку в процессе обучения в SageMaker, выводя необработанные оценки и применяя шаг постобработки. Для работы с дисбалансом классов отдавайте предпочтение взвешиванию примеров (поддерживается в SageMaker LinearLearner и многих скриптах обучения), целевому оверсэмплингу (SMOTE) или андерсэмплингу во время обучения, а также перевзвешиванию функции потерь или focal loss для нейронных сетей. Для оценки вероятностей мошенничества почти в реальном времени оптимизируйте задержку модели, используя тип инстанса с низкой задержкой инференса (ml.m5.large или инстансы, оптимизированные для CPU), сохраняйте компактность моделей (выполняйте прунинг или используйте дистиллированные модели) и используйте эндпоинты с несколькими моделями или перенаправление трафика A/B через эндпоинты SageMaker для безопасного развертывания обновлений. Отслеживайте дрейф в продуктивной среде и качество данных с помощью SageMaker Model Monitor и автоматизируйте логирование метрик в CloudWatch.
Инжиниринг признаков, мультиколлинеарность и регуляризация
Мультиколлинеарность раздувает дисперсию оценок коэффициентов в линейных моделях; обнаруживайте ее с помощью фактора инфляции дисперсии (VIF) и попарной корреляции Пирсона и устраняйте, удаляя избыточные признаки или используя понижение размерности (PCA, SVD). Регуляризация — это принципиальное решение: L2 (Ridge) сжимает коэффициенты, L1 (Lasso) создает разреженность для отбора признаков, а ElasticNet сочетает оба подхода — все они доступны в scikit-learn и SageMaker LinearLearner. К сильно скошенным числовым признакам применяйте логарифмическое преобразование или преобразование Бокса-Кокса для стабилизации дисперсии и улучшения качества линейных моделей; помните, что ансамбли деревьев устойчивы к монотонным преобразованиям, в то время как SVM и нейронным сетям для стабильного обучения требуются стандартизированные входные данные (StandardScaler). Категориальные признаки с высокой кардинальностью выигрывают от целевого кодирования (target encoding), эмбеддингов или хэширования; при использовании целевого кодирования избегайте утечки данных, вычисляя кодировки внутри фолдов кросс-валидации или на отдельной отложенной выборке. Используйте SageMaker Feature Store, чтобы централизовать и предоставлять согласованные преобразования признаков как для обучения, так и для инференса, и сохраняйте код предварительной обработки вместе с пакетами моделей или в Docker-образах, чтобы преобразования в продуктивной среде соответствовали тем, что использовались при обучении.
Методы без учителя, кластеризация, обнаружение аномалий и интерпретируемость
Кластеризация и обнаружение аномалий — это инструменты для разведочного анализа и шаги предварительной обработки для моделей с учителем. K-means (SageMaker k-means) работает быстро, но предполагает сферические кластеры и требует масштабированных признаков; выбирайте k с помощью оценок силуэта или метода локтя с осторожностью, так как инерция может быть неоднозначной. Методы на основе плотности (DBSCAN) и иерархическая кластеризация улавливают несферическую структуру, но более затратны в вычислительном плане. Для обнаружения аномалий в больших масштабах рассмотрите SageMaker Random Cut Forest для потоковых данных с датчиков и конвейеры Kinesis/Lambda для оценки почти в реальном времени; настраивайте количество деревьев и размер выборки для контроля чувствительности. Инструменты интерпретируемости критически важны: используйте встроенную в модель важность признаков для древовидных моделей и значения SHAP (SageMaker Clarify или пакет SHAP) для локальных объяснений и общих сводок о влиянии. Остерегайтесь распространенных ловушек: утечки временных данных при случайном разделении упорядоченных по времени данных, чрезмерной зависимости от точности в несбалансированных наборах данных и предположения о независимости для Naive Bayes. Для развертывания при необходимости упаковывайте пользовательские алгоритмы в Docker, предоставляйте эндпоинты для прогнозирования и проверки работоспособности и организуйте канареечные развертывания через разделение трафика на эндпоинте.
Практическая задача: FleetSight Logistics — разведочный анализ ML на изображениях грузовиков
Сценарий: FleetSight собирает около 100 ГБ изображений грузовиков в день, хранит их в S3 и использует SageMaker Studio для экспериментов, а SageMaker Ground Truth — для разметки изображений. Им нужны легковесные возможности ML для обнаружения дефектов с намерением дальнейшего масштабирования.
Задача: Определить реализуемые сценарии использования моделей с учителем и без учителя, а также недорогой конвейер для обучения начальных моделей с ограниченным количеством размеченных данных и инференса почти в реальном времени для оповещений.
Рекомендуемый подход:
- Использовать SageMaker Ground Truth с активным обучением для разметки начального набора данных; хранить размеченные данные в S3 и регистрировать признаки в SageMaker Feature Store.
- Начать с обнаружения аномалий без учителя с помощью SageMaker Random Cut Forest на метаданных датчиков, полученных из изображений, и простых эмбеддингов изображений (извлечь эмбеддинги с помощью предварительно обученной CNN в SageMaker Notebook, используя GPU ml.p3.2xlarge).
- Обучить легковесный классификатор с учителем, используя трансферное обучение (встроенный контейнер SageMaker для TensorFlow или PyTorch) на размеченной подвыборке; для получения быстрых базовых моделей извлечь эмбеддинги и обучить модель XGBoost (SageMaker XGBoost) на инстансах CPU.
- Развернуть модель XGBoost на эндпоинте SageMaker с асинхронным инференсом или на Multi-Model Endpoint для экономии затрат; отслеживать входные данные и прогнозы с помощью SageMaker Model Monitor и итеративно продолжать разметку через Ground Truth.
Обоснование: Использовать эмбеддинги без учителя + Random Cut Forest для поиска кандидатов в аномалии без большого количества размеченных данных, затем запустить обучение моделей с учителем с помощью трансферного обучения и XGBoost для компактного и быстрого инференса; сервисы SageMaker предоставляют интегрированный, масштабируемый рабочий процесс для разработки и мониторинга.
← Исследовательский анализ данных и визуализация · Все домены · Глубокое обучение и компьютерное зрение →
Отработать эти вопросы → · Тесты на время на ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Сдайте экзамен →