Компания сравнивает большие языковые модели для задачи суммаризации текста и нуждается в метрике для оценки качества суммаризации. Какая метрика подходит?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Recall-Oriented Understudy for Gisting Evaluation (ROUGE).
Почему это правильный ответ
ROUGE (Recall-Oriented Understudy for Gisting Evaluation) — это семейство метрик, специально разработанных для оценки качества автоматического суммаризации и машинного перевода. Она сравнивает сгенерированный текст с одним или несколькими эталонными суммаризациями, измеряя степень перекрытия слов, биграмм, триграмм или более длинных последовательностей. Для суммаризации текста это наиболее подходящая метрика, так как она напрямую оценивает содержание и связность. Recall (полнота) измеряет долю релевантных элементов, которые были успешно извлечены, но в чистом виде не оценивает качество суммаризации, так как не учитывает избыточность или несвязность. AUC (Area Under the ROC Curve) используется для оценки классификаторов, измеряя их способность различать классы, что не применимо к задаче суммаризации. MSE (Mean Squared Error) — это метрика для регрессионных задач, измеряющая среднюю квадратичную разницу между предсказанными и фактическими значениями, и не подходит для оценки качества текста.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется