Si addestra un classificatore di testo con un algoritmo di word-embedding integrato. Il dataset ha cinque classi con i seguenti conteggi di campioni: A=300, B=292, C=240, D=258, E=310. Si mescola e si accantona il 10% per il testing. Dopo l'addestramento, vengono prodotte matrici di confusione per i set di training e di test. Quale conclusione si può trarre da questi risultati?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Le classi C e D sono probabilmente troppo simili tra loro..
Perché questa è la risposta
La domanda implica che le matrici di confusione sono state generate, ma non le mostra. La risposta corretta suggerisce che le classi C e D sono simili, il che si manifesterebbe con un numero elevato di previsioni errate tra C e D (ad esempio, campioni di C etichettati come D e viceversa) nelle matrici di confusione. Le altre opzioni sono meno probabili o non supportate dalle informazioni fornite: Il dataset, con circa 1400 campioni, è sufficiente per un set di validazione holdout. La distribuzione delle classi (300, 292, 240, 258, 310) è relativamente bilanciata, non "fortemente sbilanciata". Non ci sono informazioni per concludere che il modello stia eseguendo l'overfitting specificamente sulle classi B ed E. L'overfitting generale si manifesterebbe con alte prestazioni sul set di training e basse sul set di test.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta