ML-инженер обучает модель логистической регрессии для прогнозирования оттока подписчиков. Набор данных включает две категориальные строковые фичи: location (3 различные категории) и job_seniority_level (более 10 различных категорий). Как следует предварительно обработать эти фичи для модели?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Использовать one-hot encoding для location. Использовать порядковое кодирование (ordinal encoding) для job_seniority_level..
Почему это правильный ответ
Для категориальной фичи location с 3 категориями лучше всего подходит one-hot encoding. Он преобразует каждую категорию в новый бинарный признак, избегая создания искусственного порядка, который может возникнуть при порядковом кодировании. Для jobsenioritylevel с более чем 10 категориями, которые, вероятно, имеют естественный порядок (например, Junior < Mid < Senior), порядковое кодирование является подходящим выбором. Оно сохраняет этот порядок, что может быть полезно для модели, и создает один числовой признак, что эффективнее, чем one-hot encoding для большого числа категорий. Токенизация обычно применяется к текстовым данным, а не к категориальным фичам. Разделение на бины (биннинг) используется для числовых фич, а не для строковых категориальных. Стандартное масштабирование применяется к числовым фичам, а не к категориальным.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется