Problem regresji w NLP ze 100 milionami etykietowanych przykładów; dane losowo przetasowane i podzielone w stosunku 90/10 na zbiór treningowy/testowy. Błąd RMSE zbioru treningowego jest dwukrotnie wyższy niż błąd RMSE zbioru testowego. Jak należy poprawić wydajność modelu?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Zwiększyć złożoność modelu, np. poprzez wprowadzenie dodatkowej warstwy lub zwiększenie rozmiaru używanych słowników lub n-gramów..
Dlaczego to jest odpowiedź
Błąd RMSE zbioru treningowego jest dwukrotnie wyższy niż błąd RMSE zbioru testowego. Taka sytuacja wskazuje na niedouczenie (underfitting) modelu. Model nie jest wystarczająco złożony, aby nauczyć się wzorców w danych treningowych, co skutkuje słabą wydajnością zarówno na zbiorze treningowym, jak i testowym. Zwiększenie złożoności modelu, np. poprzez dodanie warstw lub zwiększenie rozmiaru słowników/n-gramów, pozwoli mu lepiej uchwycić zależności w danych. Zwiększenie udziału próbki testowej nie rozwiąże problemu niedouczenia. Zebranie większej ilości danych jest zazwyczaj korzystne, ale w przypadku niedouczenia, bardziej złożony model jest priorytetem. Techniki regularyzacji służą do zapobiegania przeuczeniu (overfitting), a nie niedouczeniu.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana