Um cientista de dados usou o SageMaker Neural Topic Model (NTM) para recomendar tags para postagens de blog armazenadas como JSON no S3. O modelo sugere stopwords como "a", "an" e "the", e às vezes palavras raras, mas válidas. A equipe quer manter as palavras raras, mas garantir que as stopwords não sejam recomendadas. O que o cientista de dados deve fazer?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Remover stopwords do texto do blog usando o CountVectorizer do scikit-learn e substituir os dados no S3 pelos resultados vetorizados..
Por que esta é a resposta
A remoção de stopwords é uma etapa fundamental no pré-processamento de texto para modelos de tópicos, pois palavras comuns como "a", "an" e "the" não contribuem para a identificação de tópicos significativos. Usar o CountVectorizer do scikit-learn com uma lista de stopwords é uma maneira eficaz de filtrar essas palavras antes de treinar o modelo NTM. Substituir os dados no S3 pelos resultados vetorizados garante que o modelo seja treinado com dados limpos. Chamar o Amazon Comprehend para reconhecimento de entidade não é o ideal, pois ele se concentra em entidades nomeadas, não na remoção geral de stopwords, e pode ser um custo desnecessário. Executar o PCA (Principal Component Analysis) é uma técnica de redução de dimensionalidade que não aborda diretamente a remoção de stopwords. Usar um algoritmo de detecção de objetos é inadequado, pois é para visão computacional, não para processamento de linguagem natural.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão