Firma finansowa musi prognozować cenę towaru, wykorzystując codzienne dane historyczne. Analityk danych powinien trenować modele na 80% zbioru danych i walidować na pozostałych 20%. Jak należy podzielić dane, aby porównania modeli były prawidłowe dla prognozowania szeregów czasowych?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Wybierz datę odcięcia tak, aby 80% punktów danych przypadało przed tą datą; użyj tych wcześniejszych punktów do trenowania, a pozostałych późniejszych punktów do walidacji..
Dlaczego to jest odpowiedź
W przypadku szeregów czasowych kluczowe jest zachowanie porządku chronologicznego danych. Model powinien być trenowany na danych historycznych, aby przewidywać przyszłe wartości. Wybranie daty odcięcia, gdzie 80% danych przypada przed nią, a 20% po niej, symuluje rzeczywiste warunki, w których model uczy się na przeszłości i jest testowany na niewidzianej przyszłości. Pozostałe opcje są nieprawidłowe, ponieważ: Trenowanie na późniejszych danych i walidacja na wcześniejszych (opcja 2) narusza chronologię, co jest nielogiczne dla prognozowania. Stratyfikowany wybór (opcja 3) lub losowy wybór (opcja 4) niszczy zależności czasowe w danych, co jest krytyczne dla modeli szeregów czasowych i prowadzi do nierealistycznych ocen wydajności.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana