Una aplicación de aprendizaje de idiomas utiliza un LLM para reescribir texto y hacerlo más legible. El conjunto de datos de entrenamiento incluye texto original emparejado con versiones más legibles, y la empresa quiere que las salidas coincidan con esos ejemplos. ¿Qué métrica deberían usar para evaluar qué tan cerca coinciden las salidas del modelo con las reescrituras de referencia?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Puntuación ROUGE (Recall-Oriented Understudy for Gisting Evaluation).
Por qué esta es la respuesta
ROUGE es una métrica estándar para evaluar la calidad de la generación de texto, comparando el texto generado por el modelo con uno o más textos de referencia. Es ideal para tareas como la reescritura o el resumen, ya que mide la superposición de n-gramas, lo que indica qué tan bien las salidas del modelo coinciden con las reescrituras de referencia deseadas. El valor de la función de pérdida es una métrica de entrenamiento, no de evaluación de la calidad de la salida. La robustez semántica evalúa la estabilidad del modelo ante pequeñas perturbaciones en la entrada, no la coincidencia con referencias. La latencia de generación de texto mide la velocidad, no la calidad del texto.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta