Глобальная финансовая фирма использует регрессионную модель градиентного бустинга для оценки кредитных рейтингов клиентов. Набор данных содержит категориальные поля (например, город и жилищный статус) и финансовые поля, записанные в разных единицах (например, балансы в долларах и проценты в центах). Точность обучения составляет 99%, но точность тестирования — 75%. Какие шаги предварительной обработки наиболее улучшат производительность модели на тестовых данных?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Применить one-hot кодирование к категориальным полям, стандартизировать финансовые числовые поля и применить L1-регуляризацию..
Почему это правильный ответ
Правильный ответ улучшает производительность модели на тестовых данных, устраняя переобучение и обеспечивая правильную обработку данных. One-hot кодирование эффективно для категориальных признаков, поскольку оно не накладывает ложного порядка, что важно для градиентного бустинга. Стандартизация числовых полей, особенно с разными единицами измерения, масштабирует их, предотвращая доминирование признаков с большими значениями и улучшая сходимость модели. L1-регуляризация (Lasso) помогает бороться с переобучением, обнуляя веса наименее важных признаков, что упрощает модель и улучшает ее обобщающую способность. Токенизация и бинирование менее подходят для этих типов данных. Label-кодирование может ввести ложный порядок в категориальные данные. Логарифмическое преобразование не является стандартным для категориальных данных. Удаление выбросов может быть полезным, но не является главной причиной расхождения между точностью обучения и тестирования, указывающего на переобучение.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется