Uno scienziato di dati ha utilizzato il SageMaker Neural Topic Model (NTM) per raccomandare tag per i post del blog archiviati come JSON in S3. Il modello suggerisce stopwords come "a", "an" e "the", e talvolta parole rare ma valide. Il team vuole mantenere le parole rare ma assicurarsi che le stopwords non vengano raccomandate. Cosa dovrebbe fare lo scienziato di dati?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Rimuovere le stopwords dal testo del blog usando CountVectorizer di scikit-learn e sostituire i dati in S3 con i risultati vettorializzati..
Perché questa è la risposta
La rimozione delle stopwords è un passaggio fondamentale nella pre-elaborazione del testo per i modelli di topic modeling come NTM. L'utilizzo di CountVectorizer di scikit-learn con un elenco di stopwords integrato o personalizzato consente di eliminare parole comuni come "a", "an" e "the" che non contribuiscono al significato del topic. Sostituire i dati in S3 con il testo pulito e vettorializzato assicura che il modello NTM venga addestrato su dati più significativi, migliorando la qualità delle raccomandazioni dei tag. Le altre opzioni sono meno appropriate: Amazon Comprehend Entity Recognition non è progettato specificamente per la rimozione di stopwords e potrebbe rimuovere entità valide. L'algoritmo PCA di SageMaker è una tecnica di riduzione della dimensionalità e non un metodo per la rimozione di stopwords o la pre-elaborazione del testo in questo contesto. L'Object Detection è un algoritmo di visione artificiale e non è applicabile all'analisi del testo per il topic modeling.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta