Vous avez construit un modèle de classification d'oiseaux en divisant aléatoirement l'ensemble de données en ensembles d'entraînement et de validation. La précision de l'entraînement est très élevée, mais le modèle fonctionne mal sur l'ensemble de validation. Vous découvrez que l'ensemble de données original est déséquilibré. Que devriez-vous faire pour améliorer les performances de validation ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Utiliser l'échantillonnage stratifié lors de la création des divisions d'entraînement et de validation..
Pourquoi c'est la réponse
L'échantillonnage stratifié garantit que la proportion de chaque classe est maintenue dans les ensembles d'entraînement et de validation, reflétant ainsi la distribution de l'ensemble de données original. Cela est crucial pour les ensembles de données déséquilibrés, car une division aléatoire simple pourrait placer la plupart des exemples d'une classe minoritaire dans un seul ensemble, rendant l'autre ensemble non représentatif et conduisant à un surapprentissage (haute précision d'entraînement, faible précision de validation). Collecter plus de données pour les classes majoritaires aggraverait le déséquilibre. Entraîner sur un sous-ensemble aléatoire plus petit ne résoudrait pas le problème de déséquilibre et pourrait même réduire la quantité d'informations disponibles pour l'entraînement. L'échantillonnage systématique ne garantit pas la préservation des proportions de classes.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise