Un'azienda sta addestrando un modello linguistico di grandi dimensioni personalizzato per un chatbot rivolto agli adolescenti. Il chatbot dovrebbe utilizzare lo stile informale del pubblico, incluse ortografie creative e abbreviazioni. Quale metrica è appropriata per valutare le prestazioni del modello?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: BERTScore.
Perché questa è la risposta
BERTScore è la metrica più appropriata perché valuta la somiglianza semantica tra il testo generato dal modello e il testo di riferimento, utilizzando incorporamenti contestuali (embeddings). Questo è fondamentale per un chatbot che deve comprendere e generare linguaggio informale, incluse ortografie creative e abbreviazioni, dove le corrispondenze esatte di parole (come richiesto da BLEU e ROUGE) sarebbero penalizzanti. BLEU e ROUGE si basano principalmente sulla sovrapposizione di n-grammi, il che li rende meno efficaci nel valutare la somiglianza semantica e la flessibilità linguistica necessaria per lo slang e le abbreviazioni. Il Punteggio F1 è una media armonica di precisione e richiamo, generalmente usata per la classificazione, non per la generazione di testo.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta