Ein Data Scientist muss eine erste explorative Analyse von Kundenkommentaren mithilfe von Diagrammen und einer Wortwolke erstellen und möchte vor dem Aufbau eines NLP-Modells Feature Engineering anwenden. Welche zwei Feature-Engineering-Techniken sollten verwendet werden, um Text für die Visualisierung und Modellierung vorzubereiten? (Wählen Sie zwei.)
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Stemming, Term Frequency–Inverse Document Frequency (TF-IDF).
Warum dies die Antwort ist
Stemming reduziert Wörter auf ihre Stammform (z.B. "running" zu "run"), was die Konsistenz bei der Visualisierung (Wortwolken) und der Feature-Erstellung verbessert, indem verschiedene Formen desselben Wortes als ein einziges Merkmal behandelt werden. TF-IDF ist eine Gewichtungstechnik, die die Wichtigkeit eines Wortes in einem Dokument relativ zu einer Sammlung von Dokumenten bewertet. Dies ist entscheidend für die Modellierung, da es häufige, aber unwichtige Wörter (wie "der", "die", "das") herunterstuft und aussagekräftige Begriffe hervorhebt, was sowohl die Visualisierung als auch die Modellleistung verbessert. Named Entity Recognition und Coreference Resolution sind fortgeschrittene NLP-Techniken, die eher der Informationsgewinnung als der grundlegenden Feature-Erstellung dienen. Sentiment Analysis ist eine Anwendungsform von NLP, keine Feature-Engineering-Technik zur Vorbereitung von Text.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich