Która metryka oceny jest powszechnie używana do oceny modeli podstawowych (FM) w zadaniach podsumowywania tekstu?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Wynik Bilingual Evaluation Understudy (BLEU).
Dlaczego to jest odpowiedź
Wynik BLEU (Bilingual Evaluation Understudy) to powszechnie stosowana metryka do oceny jakości generowanego tekstu, szczególnie w zadaniach takich jak tłumaczenie maszynowe i podsumowywanie tekstu. Mierzy on podobieństwo między tekstem wygenerowanym przez model a jednym lub wieloma referencyjnymi tekstami, bazując na n-gramach. Im wyższy wynik BLEU, tym lepsza jakość podsumowania. Wynik F1 jest używany głównie do klasyfikacji, łącząc precyzję i kompletność. Dokładność (Accuracy) to również metryka klasyfikacji, mierząca odsetek poprawnych przewidywań. Błąd średniokwadratowy (MSE) jest metryką regresji, mierzącą średnią kwadratową różnicę między przewidywanymi a rzeczywistymi wartościami. Żadna z tych metryk nie nadaje się do oceny jakości generowanego tekstu w podsumowywaniu.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana