Welke bewerkingen moeten worden toegepast om 1 miljoen zinnen voor Word2Vec-embeddings (voorbeeld: "The quck BROWN FOX jumps over the lazy dog") consistent te saneren en voor te bereiden? (Kies er drie.)
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Normaliseer door alle tekens naar kleine letters te converteren., Verwijder stopwoorden met behulp van een Engelse stopwoordlijst., Tokeniseer elke zin in individuele woorden..
Waarom dit het antwoord is
Om zinnen voor Word2Vec-embeddings voor te bereiden, zijn tokenisatie, normalisatie en het verwijderen van stopwoorden essentiële stappen. Tokenisatie splitst zinnen op in individuele woorden, wat de basis vormt voor verdere verwerking. Normalisatie, zoals het omzetten naar kleine letters, zorgt voor consistentie; "Brown" en "brown" worden dan als hetzelfde woord behandeld, wat cruciaal is voor het leren van accurate embeddings. Het verwijderen van stopwoorden (zoals "the", "over") helpt ruis te verminderen en richt de focus op de meer informatieve woorden, wat de kwaliteit van de embeddings verbetert. Part-of-speech tagging en het behouden van alleen hoofdwerkwoorden en zelfstandige naamwoorden is te restrictief en verwijdert te veel context die nuttig kan zijn voor Word2Vec. Spellingcorrectie is nuttig voor tekstkwaliteit, maar niet een fundamentele voorbereidingsstap specifiek voor Word2Vec-embeddings. One-hot encoding is een alternatieve woordrepresentatie, geen voorbereidingsstap voor Word2Vec, dat juist dense embeddings creëert.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig