Une entreprise entraîne un grand modèle linguistique personnalisé pour un chatbot destiné aux adolescents. Le chatbot doit utiliser le style informel de ce public, y compris les orthographes créatives et les abréviations. Quelle métrique est appropriée pour évaluer les performances du modèle ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : BERTScore.
Pourquoi c'est la réponse
BERTScore est la métrique la plus appropriée car elle évalue la similarité sémantique entre les phrases générées et de référence en utilisant des plongements contextuels de modèles de transformeurs (comme BERT). Cela lui permet de mieux capturer la fluidité et la pertinence contextuelle, y compris les variations stylistiques comme l'argot ou les orthographes créatives, qui sont essentielles pour un chatbot destiné aux adolescents. Le score F1 est une mesure de classification qui combine la précision et le rappel, mais il n'est pas idéal pour évaluer la qualité du texte généré. ROUGE et BLEU sont des métriques basées sur le chevauchement de n-grammes. Bien qu'utiles pour évaluer la fidélité au texte de référence, elles pénalisent fortement les variations de mots ou de phrases, même si elles sont sémantiquement similaires, ce qui les rend moins adaptées pour évaluer un style informel avec des orthographes créatives et des abréviations.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise