Zsanityzowany zbiór danych zawiera cechy, których skale różnią się o rzędy wielkości. Aby zmaksymalizować dokładność przewidywania w środowisku produkcyjnym, jaką sekwencję kroków należy wykonać przed modelowaniem?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Podziel zbiór danych na zestawy treningowy, walidacyjny i testowy, a następnie przeskaluj zestaw treningowy i zastosuj te same parametry skalowania do zestawów walidacyjnego i testowego..
Dlaczego to jest odpowiedź
Prawidłowa odpowiedź zapewnia, że skalowanie danych jest wykonywane poprawnie, aby zapobiec wyciekowi danych. Najpierw należy podzielić dane na zestawy treningowy, walidacyjny i testowy. Następnie skaluje się tylko zestaw treningowy, aby model nauczył się parametrów skalowania wyłącznie na podstawie danych treningowych. Te same parametry skalowania (np. średnia i odchylenie standardowe) uzyskane z zestawu treningowego są następnie stosowane do zestawów walidacyjnych i testowych. Nieprawidłowe odpowiedzi: Losowe próbkowanie nie rozwiązuje problemu różnic w skali cech. Skalowanie całego zbioru danych przed podziałem powoduje wyciek danych, ponieważ informacje o rozkładzie danych testowych i walidacyjnych są wykorzystywane do skalowania danych treningowych. Skalowanie każdego zestawu niezależnie prowadzi do niespójnych przekształceń danych, co może negatywnie wpłynąć na wydajność modelu, ponieważ model będzie trenowany na danych o innej skali niż te, na których będzie testowany.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana