У вас есть табличный набор данных со 150 коррелированными признаками, имеющими различные числовые диапазоны, и вам необходимо уменьшить размерность с минимальным влиянием на производительность модели перед обучением регрессионной модели. Какой подход к предварительной обработке соответствует этой цели?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Открыть данные в SageMaker Data Wrangler, масштабировать признаки с помощью Min-Max scaler, затем применить встроенный алгоритм PCA SageMaker к масштабированным данным..
Почему это правильный ответ
Правильный ответ заключается в масштабировании признаков перед применением PCA. PCA чувствителен к масштабу признаков, и признаки с большими диапазонами могут доминировать в главных компонентах. Min-Max масштабирование (или стандартизация) приводит все признаки к общему диапазону, обеспечивая равный вклад каждого признака в анализ PCA. SageMaker Data Wrangler предоставляет удобный интерфейс для выполнения этих шагов предварительной обработки. Применение PCA непосредственно к необработанным данным (первый вариант) неоптимально из-за чувствительности PCA к масштабу. Удаление наиболее или наименее коррелированных признаков (третий и четвертый варианты) является менее эффективным методом уменьшения размерности по сравнению с PCA, который создает новые, некоррелированные компоненты, сохраняя при этом большую часть дисперсии данных. Использование Standard Scaler вместо Min-Max scaler также возможно, но Min-Max scaler часто предпочтителен, когда необходимо сохранить точные отношения между значениями в пределах каждого признака после масштабирования.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется