Une application d'apprentissage des langues utilise un LLM pour réécrire du texte afin de le rendre plus lisible. L'ensemble de données d'entraînement comprend le texte original associé à des versions plus lisibles, et l'entreprise souhaite que les sorties correspondent à ces exemples. Quelle métrique devrait-elle utiliser pour évaluer la correspondance entre les sorties du modèle et les réécritures de référence ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Score ROUGE (Recall-Oriented Understudy for Gisting Evaluation).
Pourquoi c'est la réponse
Le score ROUGE (Recall-Oriented Understudy for Gisting Evaluation) est une métrique standard pour évaluer la qualité du texte généré par rapport à un ou plusieurs textes de référence. Il mesure le chevauchement des n-grammes (mots ou séquences de mots) entre la sortie du modèle et les réécritures de référence, ce qui est idéal pour évaluer la correspondance dans les tâches de réécriture ou de résumé. La valeur de la fonction de perte est une métrique d'entraînement qui indique la performance du modèle pendant l'apprentissage, mais pas la qualité du texte généré. La robustesse sémantique évalue la capacité du modèle à maintenir sa performance face à de petites perturbations dans les données d'entrée, ce qui n'est pas l'objectif ici. La latence de génération de texte mesure la vitesse à laquelle le modèle produit du texte, et non la qualité ou la correspondance du contenu.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise