Korzystając z SageMaker Data Wrangler, inżynier znajduje tekstową cechę kategoryczną z tysiącami nieco różniących się wartości spowodowanych błędami pisowni. Która metoda kodowania powinna zostać użyta, aby przetworzona cecha mogła być wykorzystana do klasyfikacji?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Użyj kodowania podobieństwa (similarity encoding) do grupowania i reprezentowania podobnie pisanych kategorii..
Dlaczego to jest odpowiedź
Kodowanie podobieństwa (similarity encoding) jest najlepszym wyborem, ponieważ zostało zaprojektowane specjalnie do obsługi tekstowych cech kategorycznych z dużą liczbą podobnych, ale nie identycznych wartości, często spowodowanych błędami pisowni. Grupuje ono podobne wartości, redukując wymiarowość i poprawiając jakość danych dla modeli klasyfikacyjnych. Kodowanie porządkowe (ordinal encoding) jest nieodpowiednie, ponieważ zakłada istnienie naturalnego porządku między kategoriami, co nie ma miejsca w przypadku błędów pisowni. Kodowanie one-hot (one-hot encoding) stworzyłoby zbyt wiele kolumn dla tysięcy unikalnych wartości, prowadząc do problemu rzadkości danych (curse of dimensionality). Kodowanie docelowe (target encoding) mapuje kategorie na statystyki zmiennej docelowej, co jest przydatne, ale nie rozwiązuje problemu błędów pisowni i dużej liczby podobnych kategorii.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana