Firma szkoli niestandardowy duży model językowy dla chatbota skierowanego do nastolatków. Chatbot powinien używać nieformalnego stylu odbiorców, w tym kreatywnej pisowni i skrótów. Która metryka jest odpowiednia do oceny wydajności modelu?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: BERTScore.
Dlaczego to jest odpowiedź
BERTScore jest odpowiedni, ponieważ ocenia podobieństwo semantyczne między wygenerowanym tekstem a tekstem referencyjnym, co jest kluczowe w przypadku nieformalnego języka i kreatywnej pisowni. Wykorzystuje osadzenia kontekstowe (BERT) do mierzenia podobieństwa na poziomie słów i fraz, co pozwala na uwzględnienie synonimów i parafrazy. F1 score jest używany głównie do klasyfikacji i nie nadaje się do oceny generowania tekstu. ROUGE mierzy podobieństwo na podstawie nakładania się n-gramów, co byłoby mniej skuteczne w przypadku kreatywnej pisowni i skrótów, gdzie dosłowne dopasowanie jest rzadkie. BLEU score również opiera się na nakładaniu się n-gramów i precyzji, co czyni go mniej elastycznym w ocenie nieformalnego języka niż BERTScore.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana