Uno scienziato dei dati sta costruendo un classificatore binario di malattie da un campione casuale di 400 pazienti, dove la prevalenza della malattia è di circa il 3%. Qual è la strategia di cross-validation più appropriata per valutare il modello?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Cross-validation k-fold stratificata con k = 5..
Perché questa è la risposta
La cross-validation k-fold stratificata è la scelta migliore perché la prevalenza della malattia è molto bassa (3%). In un dataset sbilanciato, la stratificazione assicura che ogni fold mantenga la stessa proporzione di classi del dataset originale, evitando che alcuni fold abbiano pochissimi o nessun esempio della classe minoritaria. Questo fornisce una stima più affidabile e meno variabile delle prestazioni del modello. La cross-validation standard (non stratificata) potrebbe creare fold con distribuzioni di classe molto diverse, portando a valutazioni imprecise. Ripetere la cross-validation k-fold standard non risolve il problema della distribuzione sbilanciata all'interno dei singoli fold. Una singola divisione train/validation, anche se stratificata, non sfrutta appieno il dataset per la valutazione come fa la cross-validation, che testa il modello su più subset diversi.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta