Dopo aver messo a punto un modello linguistico di grandi dimensioni per rispondere alle richieste dell'help-desk, l'azienda vuole misurare se la precisione è migliorata. Quale metrica di valutazione dovrebbe utilizzare?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: F1 score.
Perché questa è la risposta
Il punteggio F1 è la metrica più appropriata perché è la media armonica di precisione e richiamo. Per le richieste dell'help-desk, è fondamentale che le risposte siano sia accurate (alta precisione) sia complete, coprendo tutti gli aspetti rilevanti della richiesta (alto richiamo). Un modello con alta precisione ma basso richiamo potrebbe perdere informazioni importanti, mentre un modello con alto richiamo ma bassa precisione potrebbe fornire molte informazioni irrilevanti o errate. Il punteggio F1 bilancia questi due aspetti, fornendo una misura complessiva della performance del modello. La precisione da sola non è sufficiente perché non considera i falsi negativi (richieste non soddisfatte). Il "Time to first token" misura la latenza e non la precisione. Il "Word error rate" è più adatto per il riconoscimento vocale e non per la valutazione della precisione semantica delle risposte testuali.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta