Analityk danych musi przeprowadzić wstępną analizę eksploracyjną komentarzy klientów, używając wykresów i chmury słów, a także chce zastosować inżynierię cech przed zbudowaniem modelu NLP. Które dwie techniki inżynierii cech należy zastosować, aby przygotować tekst do wizualizacji i modelowania? (Wybierz dwie.)
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Stemming, Term frequency–inverse document frequency (TF‑IDF).
Dlaczego to jest odpowiedź
Stemming (stemming) i TF-IDF (Term Frequency-Inverse Document Frequency) to kluczowe techniki inżynierii cech w NLP, które przygotowują tekst do analizy i modelowania. Stemming redukuje słowa do ich rdzenia (np. "biegać", "biegnie" do "bieg"), co zmniejsza liczbę unikalnych słów i ułatwia wizualizację oraz analizę częstości występowania. TF-IDF przekształca tekst w reprezentację numeryczną, ważąc słowa na podstawie ich częstości w dokumencie i rzadkości w całym korpusie, co jest niezbędne do budowania modeli NLP i identyfikacji ważnych terminów. Named entity recognition i coreference resolution to zaawansowane techniki ekstrakcji informacji, a sentiment analysis to zadanie klasyfikacji, nie zaś inżynieria cech przygotowująca tekst do wizualizacji czy modelowania.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana