Une entreprise a créé un modèle de résumé de texte génératif avec Amazon Bedrock et souhaite utiliser l'évaluation automatique de modèle de Bedrock pour mesurer la précision du modèle. Quelle métrique d'évaluation est la plus appropriée pour évaluer la qualité des résumés générés ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : BERTScore.
Pourquoi c'est la réponse
BERTScore est la métrique la plus appropriée pour évaluer la qualité des résumés générés par un modèle de langage. Elle compare la similarité sémantique entre le texte généré et le texte de référence en utilisant des plongements contextuels de modèles de transformeurs (comme BERT), ce qui permet de capturer des nuances de sens au-delà de la simple correspondance de mots. L'AUC est utilisée pour évaluer les classificateurs binaires, le score F1 est une métrique de classification qui mesure la précision et le rappel, et le score de connaissance du monde réel (RWK) n'est pas une métrique standard reconnue pour l'évaluation de la qualité des résumés.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise