Un modello di analisi del sentiment ha una bassa accuratezza di validazione e il data scientist sospetta che il problema sia un vocabolario molto ampio con una bassa frequenza media delle parole. Quale pre-elaborazione o metodo migliorerebbe al meglio l'accuratezza della validazione?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Convertire il testo in vettori di feature TF-IDF (ad esempio, utilizzando TfidfVectorizer di scikit-learn)..
Perché questa è la risposta
La conversione del testo in vettori TF-IDF (Term Frequency-Inverse Document Frequency) è la soluzione migliore. TF-IDF pondera l'importanza di una parola in un documento rispetto alla sua frequenza nell'intero corpus, riducendo l'impatto di parole comuni (stop word implicite) e dando più peso a parole rare ma significative. Questo aiuta a gestire un vocabolario ampio e parole a bassa frequenza, migliorando la rappresentazione delle feature e, di conseguenza, l'accuratezza del modello. Le altre opzioni sono meno efficaci: L'uso di Amazon Comprehend per l'analisi sintattica e il rilevamento di entità può arricchire i dati, ma non affronta direttamente il problema del vocabolario ampio e della bassa frequenza delle parole in modo così efficace come TF-IDF per la rappresentazione delle feature. L'addestramento con BlazingText in modalità CBOW è utile per generare word embeddings, ma questi modelli possono ancora lottare con parole a bassa frequenza se non sono stati visti abbastanza durante l'addestramento. TF-IDF è più diretto nel gestire l'importanza relativa delle parole. L'applicazione dello stemming e la rimozione delle stop word con NLTK sono buone pratiche di pre-elaborazione, ma da sole potrebbero non essere sufficienti per risolvere il problema di un vocabolario molto ampio e della bassa frequenza media delle parole, che TF-IDF affronta meglio attraverso la sua ponderazione.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta