Firma zbudowała model generatywnego podsumowywania tekstu za pomocą Amazon Bedrock i chce użyć automatycznej oceny modelu Bedrock do zmierzenia dokładności modelu. Która metryka oceny jest najbardziej odpowiednia do oceny jakości generowanych podsumowań?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: BERTScore.
Dlaczego to jest odpowiedź
BERTScore jest najbardziej odpowiednią metryką, ponieważ ocenia jakość generowanego tekstu poprzez porównanie go z referencyjnym tekstem, wykorzystując kontekstowe osadzanie słów (embeddings) z modeli BERT. Mierzy podobieństwo semantyczne, co jest kluczowe dla oceny podsumowań, gdzie liczy się nie tylko dokładne dopasowanie słów, ale także sens i kontekst. AUC jest używane do oceny klasyfikacji binarnej, a F1 score do oceny klasyfikacji, szczególnie w przypadku niezbalansowanych klas, co nie ma zastosowania w ocenie generowania tekstu. RWK score (Real World Knowledge) jest metryką oceniającą, czy model generuje faktycznie poprawne informacje, ale nie jest standardową metryką do oceny jakości podsumowań pod kątem ich zwięzłości i pokrycia treści.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana