Para preparar 1 milhão de frases para embeddings Word2Vec (exemplo: "The quck BROWN FOX jumps over the lazy dog"), quais operações devem ser aplicadas para higienizar e preparar o texto de forma consistente? (Escolha três.)
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Normalizar convertendo todos os caracteres para minúsculas., Remover stop words usando uma lista de stop words em inglês., Tokenizar cada frase em palavras individuais..
Por que esta é a resposta
Para Word2Vec, a tokenização (dividir frases em palavras) é fundamental, pois o modelo opera em palavras individuais. A normalização para minúsculas garante que "Fox" e "fox" sejam tratadas como a mesma palavra, reduzindo a dimensionalidade do vocabulário e melhorando a consistência. A remoção de stop words (palavras comuns como "the", "a", "is") é crucial porque elas adicionam ruído e pouca informação semântica, o que pode diluir a qualidade dos embeddings. A marcação de parte da fala e a retenção de apenas verbos/substantivos são muito restritivas e podem descartar informações contextuais valiosas para Word2Vec. A correção de erros de ortografia é útil, mas não é uma etapa obrigatória para a preparação básica de Word2Vec e pode ser computacionalmente cara para 1 milhão de frases. A codificação one-hot não é usada com Word2Vec; ele gera embeddings densos, não representações esparsas como one-hot.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão