¿Qué métrica de evaluación se usa comúnmente para evaluar modelos fundacionales (FM) en tareas de resumen de texto?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Puntuación BLEU (Bilingual Evaluation Understudy).
Por qué esta es la respuesta
La puntuación BLEU (Bilingual Evaluation Understudy) es la métrica más común para evaluar la calidad de los modelos de resumen de texto. Compara el resumen generado por el modelo con uno o más resúmenes de referencia escritos por humanos, analizando la superposición de n-gramas. Una puntuación más alta indica una mayor similitud con los resúmenes de referencia. La Puntuación F1 es una métrica de clasificación que combina precisión y exhaustividad, no adecuada para la evaluación de texto generativo. La Precisión (Accuracy) también es una métrica de clasificación que mide la proporción de predicciones correctas, no aplicable directamente a la calidad del resumen. El Error cuadrático medio (MSE) se utiliza para evaluar modelos de regresión, midiendo la diferencia promedio entre los valores predichos y los valores reales, lo cual es irrelevante para la evaluación de resúmenes de texto.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta