Después de ajustar un modelo de lenguaje grande para responder consultas de mesa de ayuda, la empresa quiere medir si la precisión mejoró. ¿Qué métrica de evaluación deberían usar?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: F1 score.
Por qué esta es la respuesta
La puntuación F1 es la métrica más adecuada porque equilibra la precisión (cuántas respuestas correctas dio el modelo de las que predijo como correctas) y la exhaustividad (cuántas respuestas correctas identificó el modelo del total de respuestas correctas posibles). Para las consultas de la mesa de ayuda, es crucial que el modelo no solo sea preciso, sino que también capture la mayoría de las respuestas correctas. La precisión por sí sola podría ignorar muchas respuestas correctas, mientras que la exhaustividad por sí sola podría incluir muchas respuestas incorrectas. "Time to first token" mide la latencia, no la precisión. "Word error rate" se usa para el reconocimiento de voz o la traducción automática, no para la precisión de las respuestas generadas.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta