Um modelo de análise de sentimento tem baixa precisão de validação, e o cientista de dados suspeita que um vocabulário muito grande com baixa frequência média de palavras seja o problema. Qual pré-processamento ou método melhoraria a precisão da validação?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Converter texto em vetores de características TF-IDF (por exemplo, usando TfidfVectorizer do scikit-learn)..
Por que esta é a resposta
A conversão de texto em vetores TF-IDF (Term Frequency-Inverse Document Frequency) é a melhor abordagem. TF-IDF atribui pesos às palavras com base em sua frequência no documento e sua raridade em todo o corpus, dando mais importância a termos distintivos. Isso ajuda a reduzir o impacto de um vocabulário grande e de palavras de baixa frequência, que podem introduzir ruído e diluir a importância de termos mais relevantes, melhorando a representação do texto e, consequentemente, a precisão do modelo. Usar o Amazon Comprehend para análise de sintaxe e detecção de entidades é útil para extrair informações, mas não aborda diretamente o problema de um vocabulário grande e de baixa frequência que afeta a precisão. Treinar com BlazingText no modo CBOW é uma técnica de word embedding, que pode ser útil, mas TF-IDF é mais direto para lidar com a questão da relevância de termos em um vocabulário grande. Aplicar stemming e remover stop words (NLTK) é um bom pré-processamento, mas pode não ser suficiente para resolver o problema de um vocabulário excessivamente grande e com muitas palavras de baixa frequência por si só; TF-IDF oferece uma ponderação mais sofisticada.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão