Firma porównuje duże modele językowe do zadania podsumowywania tekstu i potrzebuje metryki do oceny jakości podsumowania. Która metryka jest odpowiednia?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Recall-Oriented Understudy for Gisting Evaluation (ROUGE).
Dlaczego to jest odpowiedź
ROUGE (Recall-Oriented Understudy for Gisting Evaluation) to zestaw metryk powszechnie stosowanych do oceny jakości podsumowań tekstu lub tłumaczeń maszynowych. Mierzy on podobieństwo między podsumowaniem wygenerowanym przez model a jednym lub większą liczbą podsumowań referencyjnych (stworzonych przez człowieka), licząc nakładające się jednostki, takie jak n-gramy, sekwencje wyrazów lub pary wyrazów. Recall mierzy zdolność modelu do uchwycenia wszystkich istotnych informacji, ale nie ocenia spójności ani zwięzłości podsumowania. AUC jest używane do oceny klasyfikatorów binarnych, a MSE do regresji, więc nie są odpowiednie do oceny jakości podsumowań tekstu.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana