Ein Pharmaunternehmen prüft Dokumente von klinischen Studienstandorten (Text) und muss die 10 wichtigsten Themen im gesamten Korpus ermitteln, damit die Prüfer die Überprüfungen priorisieren können. Dokumente, die unerwünschte Ereignisse erwähnen, müssen priorisiert werden. Ein Datenwissenschaftler wird statistische Themenmodellierung verwenden, um abstrakte Themen zu finden und die wichtigsten Wörter pro Thema aufzulisten. Welche Algorithmen eignen sich am besten? (Wählen Sie zwei.)
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Latent Dirichlet Allocation (LDA), Neural topic modeling (NTM).
Warum dies die Antwort ist
Latent Dirichlet Allocation (LDA) ist ein bewährter statistischer Ansatz für die Themenmodellierung. Er identifiziert latente Themen in einem Dokumentkorpus und ordnet jedem Dokument eine Wahrscheinlichkeitsverteilung über diese Themen zu, was ideal ist, um die wichtigsten Themen und zugehörige Schlüsselwörter zu finden. Neural Topic Modeling (NTM) ist eine moderne, neuronale Netzwerk-basierte Methode, die ebenfalls Themen aus Textdaten extrahiert. NTMs können oft komplexere Muster und Beziehungen in den Daten erfassen als traditionelle Methoden. Random Forest Classifier und Linear Support Vector Machine sind Klassifikationsalgorithmen, die für die Themenmodellierung ungeeignet sind, da sie Dokumente kategorisieren, anstatt latente Themen zu entdecken. Lineare Regression wird für die Vorhersage kontinuierlicher Werte verwendet und ist ebenfalls nicht für die Themenmodellierung konzipiert.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich