Après avoir affiné un grand modèle linguistique pour répondre aux requêtes du service d'assistance, l'entreprise souhaite mesurer si la précision s'est améliorée. Quelle métrique d'évaluation devrait-elle utiliser ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Score F1.
Pourquoi c'est la réponse
Le Score F1 est la métrique la plus appropriée car il combine la précision (proportion de prédictions positives correctes) et le rappel (proportion d'instances positives réelles correctement identifiées) en une seule valeur. Pour un modèle de service d'assistance, il est crucial de minimiser les fausses positives (mauvaises réponses) et les fausses négatives (questions sans réponse pertinente), ce que le Score F1 évalue efficacement. La Précision seule ne tiendrait pas compte des requêtes non résolues. Le Temps jusqu'au premier token mesure la latence, pas la qualité de la réponse. Le Taux d'erreur de mots est plus pertinent pour la reconnaissance vocale ou la traduction, pas directement pour la pertinence sémantique d'une réponse de chatbot.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise