Trenujesz klasyfikator tekstu z wbudowanym algorytmem osadzania słów. Zbiór danych ma pięć klas z następującą liczbą próbek: A=300, B=292, C=240, D=258, E=310. Tasujesz i odkładasz 10% na testowanie. Po treningu tworzone są macierze pomyłek dla zbiorów treningowych i testowych. Jaki wniosek można wyciągnąć z tych wyników?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Klasy C i D są prawdopodobnie zbyt podobne do siebie..
Dlaczego to jest odpowiedź
Poprawna odpowiedź to "Klasy C i D są prawdopodobnie zbyt podobne do siebie." Macierz pomyłek (confusion matrix) pokazuje, jak dobrze model klasyfikuje próbki. Jeśli klasy C i D są często mylone ze sobą, oznacza to, że model ma trudności z ich rozróżnieniem, co sugeruje ich podobieństwo. Pozostałe opcje są nieprawidłowe: "Zbiór danych jest zbyt mały, aby używać zbioru walidacyjnego typu holdout." Zbiór danych liczy 1400 próbek (300+292+240+258+310), co jest wystarczające do podziału na zbiory treningowy i testowy. "Rozkład klas jest mocno skośny." Liczba próbek w klasach (od 240 do 310) jest stosunkowo zbalansowana, więc rozkład nie jest mocno skośny. "Model nadmiernie dopasowuje się do klas B i E." Bez macierzy pomyłek nie można stwierdzić nadmiernego dopasowania do konkretnych klas. Nadmierne dopasowanie objawia się wysoką dokładnością na zbiorze treningowym i niską na testowym, a nie specyficznym zachowaniem dla klas B i E.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana