Model analizy sentymentu ma niską dokładność walidacji, a analityk danych podejrzewa, że problemem jest bardzo duży słownik z niską średnią częstotliwością słów. Które wstępne przetwarzanie lub metoda najlepiej poprawiłaby dokładność walidacji?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Konwersja tekstu na wektory cech TF-IDF (na przykład przy użyciu TfidfVectorizer z scikit-learn)..
Dlaczego to jest odpowiedź
Konwersja tekstu na wektory cech TF-IDF jest najlepszym rozwiązaniem, ponieważ TF-IDF (Term Frequency-Inverse Document Frequency) skutecznie radzi sobie z dużymi słownikami i rzadkimi słowami. Metoda ta przypisuje większą wagę słowom, które są częste w danym dokumencie, ale rzadkie w całym korpusie, co pomaga wyróżnić słowa kluczowe i zmniejszyć wpływ bardzo rzadkich słów. Pozostałe opcje są mniej skuteczne: Użycie Amazon Comprehend do analizy składniowej i wykrywania encji jest przydatne, ale nie rozwiązuje bezpośrednio problemu dużego słownika z niską częstotliwością słów, który wpływa na ogólną reprezentację tekstu. Trenowanie przy użyciu Amazon SageMaker BlazingText w trybie CBOW generuje osadzenia słów, ale samo w sobie nie redukuje wymiarowości ani nie filtruje rzadkich słów w sposób tak ukierunkowany jak TF-IDF. Zastosowanie stemmingu i usunięcie stop words zmniejsza rozmiar słownika i usuwa słowa o małym znaczeniu, ale nie adresuje problemu niskiej średniej częstotliwości słów w tak efektywny sposób jak TF-IDF, które uwzględnia również unikalność słów w kontekście całego korpusu.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana