Inżynier ML trenuje model regresji logistycznej do przewidywania rezygnacji z subskrypcji. Zbiór danych zawiera dwie kategoryczne cechy tekstowe: location (3 różne kategorie) i job_seniority_level (ponad 10 różnych kategorii). Jak należy przetworzyć wstępnie te cechy dla modelu?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Użycie kodowania one-hot dla location. Użycie kodowania porządkowego dla job_seniority_level..
Dlaczego to jest odpowiedź
Prawidłowa odpowiedź to użycie kodowania one-hot dla location i kodowania porządkowego dla jobsenioritylevel. Location ma tylko 3 kategorie, co sprawia, że kodowanie one-hot jest odpowiednie, ponieważ tworzy ono nowe, binarne cechy dla każdej kategorii, unikając wprowadzania sztucznej kolejności. Jobsenioritylevel ma ponad 10 kategorii i naturalny porządek (np. Junior < Mid < Senior), dlatego kodowanie porządkowe jest właściwe, mapując kategorie na wartości liczbowe odzwierciedlające tę kolejność. Tokenizacja jest zazwyczaj używana dla swobodnego tekstu, a nie dla predefiniowanych kategorii. Bining jest dla cech ciągłych. Skalowanie standardowe jest dla cech numerycznych, a nie kategorycznych.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana