Un'azienda finanziaria deve prevedere il prezzo di una materia prima utilizzando dati storici giornalieri. Il data scientist dovrebbe addestrare i modelli sull'80% del set di dati e convalidarli sul restante 20%. Come dovrebbero essere suddivisi i dati affinché i confronti tra i modelli siano validi per la previsione di serie temporali?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Scegliere una data di cutoff in modo che l'80% dei punti dati si verifichi prima di tale data; utilizzare questi punti precedenti per l'addestramento e i restanti punti successivi per la convalida..
Perché questa è la risposta
Per le serie temporali, è fondamentale mantenere l'ordine cronologico dei dati. Addestrare il modello su dati passati e convalidarlo su dati futuri (non visti) simula l'uso reale del modello per la previsione. L'opzione corretta rispetta questo principio, utilizzando l'80% dei dati più vecchi per l'addestramento e il 20% più recente per la convalida. Le altre opzioni non sono adatte perché: invertire l'ordine (addestrare su dati futuri e convalidare su dati passati) non ha senso per la previsione; la selezione stratificata o il campionamento casuale distruggono la dipendenza temporale intrinseca dei dati, portando a una valutazione irrealistica delle prestazioni del modello.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta