Проблема регрессии в NLP с 100M размеченных примеров; данные случайным образом перемешаны и разделены на обучающую/тестовую выборки в соотношении 90/10. RMSE на обучающей выборке в два раза выше, чем RMSE на тестовой выборке. Как следует улучшить производительность модели?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Увеличить сложность модели, например, добавив дополнительный слой или увеличив размер используемых словарей или n-грамм..
Почему это правильный ответ
Если RMSE на обучающей выборке значительно выше, чем на тестовой, это указывает на недообучение (underfitting). Модель недостаточно сложна, чтобы уловить закономерности в обучающих данных. Увеличение сложности модели, например, добавление дополнительных слоев в нейронную сеть или использование более крупных словарей/n-грамм для извлечения признаков, позволит ей лучше аппроксимировать обучающие данные и, следовательно, снизить RMSE на обучающей выборке. Увеличение доли тестовой выборки не решит проблему недообучения. Сбор большего количества данных не поможет, если текущая модель уже не справляется с существующими данными. Методы регуляризации (dropout, batch normalization) используются для борьбы с переобучением (overfitting), когда модель слишком хорошо запоминает обучающие данные, но плохо обобщает на новые, что проявляется в низком RMSE на обучающей выборке и высоком на тестовой. В данном случае ситуация обратная.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется