Un'app per l'apprendimento delle lingue utilizza un LLM per riscrivere il testo in modo che sia più leggibile. Il dataset di training include il testo originale abbinato a versioni più leggibili e l'azienda desidera che gli output corrispondano a tali esempi. Quale metrica dovrebbero usare per valutare quanto gli output del modello corrispondano alle riscritture di riferimento?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Punteggio ROUGE (Recall-Oriented Understudy for Gisting Evaluation).
Perché questa è la risposta
Il punteggio ROUGE è la metrica più appropriata per valutare la somiglianza tra il testo generato dal modello e i testi di riferimento (ground truth) in attività come la riscrittura o il riassunto. Misura la sovrapposizione di n-grammi, sequenze di parole o coppie di parole tra i due testi, indicando quanto il modello abbia "ricordato" il contenuto del riferimento. Il valore della funzione di perdita è una metrica interna utilizzata durante l'addestramento per guidare l'ottimizzazione del modello, non per valutare la qualità dell'output finale rispetto a un riferimento umano. La robustezza semantica valuta come le piccole modifiche all'input influenzano l'output, non la somiglianza con un riferimento. La latenza di generazione del testo misura la velocità di inferenza del modello, non la qualità del testo prodotto.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta