Problème de régression en PNL avec 100 millions d'exemples étiquetés ; les données sont mélangées aléatoirement et divisées en 90/10 pour l'entraînement/le test. Le RMSE d'entraînement est deux fois plus élevé que le RMSE de test. Comment améliorer les performances du modèle ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Augmenter la complexité de votre modèle en, par exemple, introduisant une couche supplémentaire ou en augmentant la taille des vocabulaires ou des n-grammes utilisés..
Pourquoi c'est la réponse
Le RMSE d'entraînement étant deux fois plus élevé que le RMSE de test indique un sous-apprentissage (underfitting). Le modèle est trop simple pour capturer les relations dans les données d'entraînement. Augmenter la complexité du modèle, par exemple en ajoutant une couche ou en augmentant la taille des vocabulaires/n-grammes, lui permettra d'apprendre des motifs plus complexes et de réduire le RMSE d'entraînement. Les autres options sont incorrectes : Augmenter la part de l'échantillon de test ne résoudra pas le sous-apprentissage et pourrait réduire la quantité de données d'entraînement disponibles. Collecter plus de données est utile pour le surapprentissage, mais pas pour le sous-apprentissage, car le modèle actuel ne peut déjà pas apprendre des données existantes. Les techniques de régularisation sont utilisées pour prévenir le surapprentissage (overfitting), ce qui est l'opposé du problème actuel.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise