Aby przygotować 1 milion zdań do osadzeń Word2Vec (przykład: „The quck BROWN FOX jumps over the lazy dog”), które operacje należy zastosować, aby spójnie oczyścić i przygotować tekst? (Wybierz trzy.)
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Normalizuj, konwertując wszystkie znaki na małe litery., Usuń stop words, używając angielskiej listy stopwordów., Tokenizuj każde zdanie na pojedyncze słowa..
Dlaczego to jest odpowiedź
Aby przygotować tekst do osadzeń Word2Vec, kluczowe jest ujednolicenie i przetworzenie danych. Tokenizacja rozbija zdania na pojedyncze słowa, co jest podstawą do dalszej analizy. Normalizacja poprzez konwersję na małe litery zapewnia, że Word2Vec traktuje „The” i „the” jako to samo słowo, redukując wariancje i poprawiając jakość osadzeń. Usunięcie stop words (takich jak „a”, „an”, „the”) eliminuje często występujące słowa, które zazwyczaj nie wnoszą znaczącej wartości semantycznej, pozwalając modelowi skupić się na bardziej informacyjnych terminach. Tagowanie części mowy i zachowanie tylko czasowników/rzeczowników jest zbyt agresywną redukcją, która może usunąć istotny kontekst. Naprawianie błędów ortograficznych jest kosztowne obliczeniowo i nie zawsze konieczne, a Word2Vec może nauczyć się osadzeń dla błędnie napisanych słów, jeśli występują one wystarczająco często. Kodowanie one-hot jest alternatywną metodą reprezentacji słów, ale nie jest to operacja przygotowawcza do osadzeń Word2Vec, które uczą się gęstych wektorów.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana