Masz zbiór danych o lokalizacjach dostawców, zapisanych jako dwuliterowe kody krajów (na przykład NZ dla Nowej Zelandii). Musisz przekształcić te kody w zmienne numeryczne do trenowania modelu, jednocześnie (1) unikając utraty informacji i (2) minimalizując wzrost wymiarowości. Która transformacja spełnia te wymagania?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Przekształć dwuliterowe kody krajów w cechy numeryczne za pomocą kodowania podobieństwa (similarity encoding)..
Dlaczego to jest odpowiedź
Kodowanie podobieństwa (similarity encoding) jest najlepszym wyborem, ponieważ przekształca kody krajów w wektory numeryczne, które zachowują relacje podobieństwa między krajami (np. geograficzne, kulturowe), minimalizując jednocześnie wzrost wymiarowości w porównaniu do kodowania one-hot. Dodanie pełnej nazwy kraju nie tworzy zmiennej numerycznej i może być trudne do przetworzenia przez model. Przyporządkowanie do kontynentu upraszcza dane, ale powoduje znaczną utratę informacji, ponieważ wiele krajów na tym samym kontynencie zostanie potraktowanych jako identyczne. Kodowanie one-hot tworzy osobną kolumnę binarną dla każdego kraju, co prowadzi do drastycznego wzrostu wymiarowości, zwłaszcza przy dużej liczbie unikalnych kodów krajów, i nie uwzględnia podobieństw między nimi.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana