Инженер по машинному обучению, подготавливающий данные для модели классификации, замечает, что некоторые непрерывные числовые признаки имеют значения намного большие, чем остальные. Эксперт в предметной области подтверждает, что признаки информативны, а набор данных репрезентативен. Точность обученной модели ниже ожидаемой. Какой шаг предварительной обработки данных наиболее значительно улучшит точность инференса?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Нормализовать признаки с непропорционально большими значениями..
Почему это правильный ответ
Нормализация признаков (например, масштабирование до диапазона [0,1] или стандартизация до нулевого среднего и единичной дисперсии) является ключевым шагом, когда признаки имеют сильно различающиеся масштабы. Это предотвращает доминирование признаков с большими значениями в процессе обучения модели, позволяя всем признакам вносить пропорциональный вклад. Многие алгоритмы машинного обучения, особенно те, которые используют градиентный спуск или вычисление расстояний (например, SVM, нейронные сети, K-ближайшие соседи), очень чувствительны к масштабу признаков. Бутстрап (повторная выборка с заменой) используется для оценки статистических показателей или создания нескольких моделей, но не решает проблему масштаба признаков. Удаление информативных признаков приведет к потере ценной информации и ухудшению производительности. Создание экстраполированных синтетических признаков может ввести шум или неточности, особенно если исходные данные уже имеют проблемы с масштабом.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется