Firma używa Amazon SageMaker do tworzenia streszczeń artykułów w kilku językach i potrzebuje metryki do oceny jakości przetłumaczonych streszczeń w różnych językach. Której metryki oceny powinni użyć?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Bilingual Evaluation Understudy (BLEU).
Dlaczego to jest odpowiedź
Bilingual Evaluation Understudy (BLEU) jest odpowiednią metryką, ponieważ została zaprojektowana specjalnie do oceny jakości tekstu wygenerowanego przez maszynę w porównaniu z jednym lub kilkoma referencyjnymi tłumaczeniami ludzkimi. Mierzy podobieństwo n-gramów między tłumaczeniem maszynowym a tłumaczeniem referencyjnym, co jest kluczowe przy ocenie streszczeń w różnych językach. ROUGE (Recall-Oriented Understudy for Gisting Evaluation) jest używana głównie do oceny streszczeń, ale koncentruje się na odtworzeniu (recall) i jest mniej odpowiednia do porównywania tłumaczeń między językami. AUC (Area Under the ROC Curve) to metryka używana do oceny klasyfikatorów binarnych, a Precision to metryka używana do oceny klasyfikacji, a nie jakości tłumaczenia tekstu.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana