Un'azienda sta creando un classificatore per valutare le prestazioni di vendita mensili (1-5) degli ultimi 20 anni. Il dataset include il mese, la regione di vendita, le vendite aggregate regionali e il numero di negozi. Due mesi ogni anno mostrano vendite aggregate costantemente elevate (picchi stagionali). Dopo la codifica one-hot delle feature categoriche e l'addestramento, l'accuratezza del modello sul set di convalida è peggiore del previsto. Quale passaggio migliorerà molto probabilmente l'accuratezza della convalida?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Utilizzare una suddivisione stratificata train/validation che preservi le distribuzioni per mese e regione di vendita..
Perché questa è la risposta
La suddivisione stratificata train/validation è cruciale quando il dataset presenta distribuzioni sbilanciate o pattern stagionali, come i picchi di vendita mensili e le variazioni regionali descritte. Mantenere la proporzione di queste categorie (mese, regione) in entrambi i set di training e validazione assicura che il modello impari da un campione rappresentativo e venga valutato su dati che riflettono la realtà, migliorando l'accuratezza della convalida. Rimuovere gli outlier indiscriminatamente può eliminare informazioni utili, specialmente se i picchi di vendita sono eventi reali. La normalizzazione delle vendite aggregate è una buona pratica, ma la sua efficacia dipende dal modello e dalla distribuzione dei dati, e potrebbe non risolvere il problema della rappresentatività del dataset come la stratificazione. Normalizzare per regione o globalmente ha effetti diversi, ma non affronta la questione fondamentale della divisione dei dati.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta