Un'azienda ha creato un modello di riepilogo di testo generativo con Amazon Bedrock e vuole utilizzare la valutazione automatica del modello di Bedrock per misurare l'accuratezza del modello. Quale metrica di valutazione è più appropriata per valutare la qualità dei riepiloghi generati?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: BERTScore.
Perché questa è la risposta
BERTScore è la metrica più appropriata per valutare la qualità dei riepiloghi generati perché confronta la somiglianza semantica tra il testo generato e il testo di riferimento utilizzando gli embedding contestuali di BERT. Questo è fondamentale per i riepiloghi, dove non è richiesta una corrispondenza esatta delle parole, ma la conservazione del significato. L'AUC è per la classificazione binaria. L'F1 score è utile per la classificazione e il riconoscimento di entità, ma meno per la qualità semantica dei riepiloghi. Il punteggio RWK (Real World Knowledge) è una metrica per la valutazione della conoscenza fattuale, non direttamente per la qualità del riepilogo testuale.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta