Una empresa creó un modelo de resumen de texto generativo con Amazon Bedrock y quiere usar la evaluación automática de modelos de Bedrock para medir la precisión del modelo. ¿Qué métrica de evaluación es la más adecuada para evaluar la calidad de los resúmenes generados?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: BERTScore.
Por qué esta es la respuesta
BERTScore es la métrica más adecuada para evaluar la calidad de los resúmenes generados por un modelo generativo. Mide la similitud semántica entre el resumen generado y una o varias referencias humanas, utilizando incrustaciones contextuales de BERT. Esto permite una evaluación más matizada de la calidad del texto que las métricas basadas en la coincidencia de palabras. AUC (Área bajo la curva ROC) se usa para clasificaciones binarias. La puntuación F1 es una medida de precisión y exhaustividad, comúnmente utilizada en tareas de clasificación o recuperación de información, no ideal para la calidad semántica de resúmenes. La puntuación de conocimiento del mundo real (RWK) no es una métrica estándar de evaluación de modelos generativos en Bedrock.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta