Firma farmaceutyczna audytuje dokumenty (tekstowe) z miejsc badań klinicznych i musi odkryć 10 najważniejszych tematów w całym korpusie, aby audytorzy mogli ustalić priorytety przeglądów. Dokumenty wspominające o zdarzeniach niepożądanych muszą mieć priorytet. Analityk danych użyje statystycznego modelowania tematów, aby znaleźć abstrakcyjne tematy i wymienić najważniejsze słowa dla każdego tematu. Które algorytmy są najlepiej dopasowane? (Wybierz dwie.)
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Latent Dirichlet Allocation (LDA), Neural topic modeling (NTM).
Dlaczego to jest odpowiedź
Latent Dirichlet Allocation (LDA) i Neural Topic Modeling (NTM) to algorytmy do modelowania tematów, które są przeznaczone do odkrywania abstrakcyjnych tematów w kolekcjach dokumentów tekstowych. LDA jest klasycznym probabilistycznym modelem generatywnym, który identyfikuje ukryte tematy i przypisuje słowa do tych tematów. NTM to nowoczesne podejście wykorzystujące sieci neuronowe do modelowania tematów, często oferujące większą elastyczność i zdolność do uchwycenia złożonych relacji. Oba algorytmy są odpowiednie do identyfikacji 10 najważniejszych tematów i związanych z nimi słów kluczowych. Random forest classifier i Linear support vector machine to algorytmy klasyfikacji, używane do przypisywania etykiet do danych, a nie do odkrywania tematów. Linear regression to algorytm regresji, służący do przewidywania wartości ciągłych.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana