Welche Operationen sollten angewendet werden, um 1 Million Sätze für Word2Vec-Embeddings (Beispiel: „The quck BROWN FOX jumps over the lazy dog“) konsistent zu bereinigen und vorzubereiten? (Wählen Sie drei.)
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Normalisieren durch Konvertieren aller Zeichen in Kleinbuchstaben., Stoppwörter mithilfe einer englischen Stoppwortliste entfernen., Jeden Satz in einzelne Wörter zerlegen (Tokenisierung)..
Warum dies die Antwort ist
Die Tokenisierung zerlegt Sätze in einzelne Wörter, was für Word2Vec unerlässlich ist, da es auf der Analyse von Wörtern basiert. Die Normalisierung durch Konvertierung in Kleinbuchstaben stellt sicher, dass Wörter wie „Fox“ und „fox“ als dasselbe Wort behandelt werden, was die Konsistenz der Embeddings verbessert. Das Entfernen von Stoppwörtern eliminiert häufige, aber semantisch wenig aussagekräftige Wörter (z.B. „the“, „is“), die das Modell sonst unnötig beeinflussen könnten, und verbessert so die Qualität der Wortrepräsentationen. Part-of-Speech-Tagging und das Beibehalten nur bestimmter Wortarten würde zu viele Informationen entfernen und die Kontextualisierung für Word2Vec beeinträchtigen. Die Korrektur von Rechtschreibfehlern ist zwar nützlich, aber keine grundlegende Anforderung für Word2Vec und kann komplex sein. One-Hot-Encoding ist eine alternative Wortrepräsentation, die nicht mit Word2Vec kombiniert wird, da Word2Vec selbst dichte Embeddings erzeugt.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich