Una empresa está entrenando un modelo de lenguaje grande personalizado para un chatbot dirigido a adolescentes. El chatbot debe usar el estilo informal de la audiencia, incluyendo ortografía creativa y abreviaturas. ¿Qué métrica es apropiada para evaluar el rendimiento del modelo?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: BERTScore.
Por qué esta es la respuesta
BERTScore es la métrica más adecuada porque evalúa la similitud semántica entre el texto generado y el texto de referencia utilizando incrustaciones contextuales de modelos como BERT. Esto le permite capturar la calidad del lenguaje, incluso con variaciones en la ortografía y la gramática, lo cual es crucial para un chatbot que imita el lenguaje informal de los adolescentes. F1 score, ROUGE y BLEU son métricas basadas principalmente en la superposición de n-gramas. Si bien son útiles para evaluar la precisión de la traducción o el resumen, no son tan efectivas para capturar la fluidez y el estilo del lenguaje con ortografía creativa y abreviaturas, ya que penalizarían estas variaciones como errores en lugar de como un estilo intencional.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta