Per preparare 1 milione di frasi per gli embedding Word2Vec (esempio: "The quck BROWN FOX jumps over the lazy dog"), quali operazioni dovrebbero essere applicate per sanificare e preparare il testo in modo coerente? (Scegliere tre.)
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Normalizzare convertendo tutti i caratteri in minuscolo., Rimuovere le stop word usando una lista di stopword inglesi., Tokenizzare ogni frase in singole parole..
Perché questa è la risposta
Per Word2Vec, è fondamentale preparare il testo in modo coerente. La tokenizzazione scompone le frasi in singole parole, che sono le unità di input per il modello. La normalizzazione in minuscolo standardizza il testo, trattando "The" e "the" come la stessa parola, riducendo la dimensionalità del vocabolario e migliorando l'apprendimento degli embedding. La rimozione delle stop word (es. "the", "a", "is") elimina parole comuni che aggiungono poco significato semantico, concentrando il modello sulle parole più informative. Il part-of-speech tagging e la selezione di solo verbi e nomi limiterebbero eccessivamente il contesto, impoverendo gli embedding. La correzione ortografica è utile ma non è un passaggio fondamentale per la sanificazione di base per Word2Vec e può essere complessa. L'one-hot encoding non è una tecnica di pre-elaborazione per Word2Vec; è un metodo alternativo per rappresentare le parole, ma Word2Vec genera embedding densi, non one-hot.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta