Vous entraînez un classifieur de texte avec un algorithme d'intégration de mots (word-embedding) intégré. L'ensemble de données comporte cinq classes avec les nombres d'échantillons suivants : A=300, B=292, C=240, D=258, E=310. Vous mélangez et mettez de côté 10 % pour les tests. Après l'entraînement, des matrices de confusion pour les ensembles d'entraînement et de test sont produites. Quelle conclusion peut être tirée de ces résultats ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Les classes C et D sont probablement trop similaires l'une à l'autre..
Pourquoi c'est la réponse
L'option correcte est que les classes C et D sont probablement trop similaires l'une à l'autre. Une matrice de confusion est essentielle pour évaluer les performances d'un classifieur, en particulier pour identifier les confusions entre classes. Si le modèle prédit fréquemment la classe D alors que la vraie classe est C, et vice versa, cela indique une forte similarité entre ces deux classes, ce qui rend difficile pour le modèle de les distinguer. Les autres options sont incorrectes : La taille de l'ensemble de données (environ 1400 échantillons) est suffisante pour une validation holdout standard (10% pour les tests). La distribution des classes (300, 292, 240, 258, 310) est relativement équilibrée et non fortement asymétrique. Sans les matrices de confusion réelles, il est impossible de conclure à un surapprentissage spécifique sur les classes B et E. Le surapprentissage serait généralement détecté par une performance significativement meilleure sur l'ensemble d'entraînement que sur l'ensemble de test, et non par une confusion spécifique entre classes.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise