Você treina um classificador de texto com um algoritmo de word-embedding integrado. O conjunto de dados tem cinco classes com as seguintes contagens de amostras: A=300, B=292, C=240, D=258, E=310. Você embaralha e separa 10% para teste. Após o treinamento, as matrizes de confusão para os conjuntos de treinamento e teste são produzidas. Que conclusão pode ser tirada desses resultados?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: As classes C e D são provavelmente muito semelhantes entre si..
Por que esta é a resposta
A explicação correta é que as classes C e D são provavelmente muito semelhantes entre si. Isso porque o word-embedding, ao mapear palavras para vetores, pode agrupar termos semanticamente próximos. Se as classes C e D contêm textos com vocabulário e contexto muito similares, o modelo terá dificuldade em diferenciá-las, resultando em erros de classificação entre elas na matriz de confusão. As outras opções estão incorretas: O conjunto de dados não é muito pequeno para um conjunto de validação holdout; 10% para teste é uma prática comum e adequada para este tamanho de dados. A distribuição das classes (A=300, B=292, C=240, D=258, E=310) não é muito distorcida; as contagens são razoavelmente equilibradas, sem uma classe dominando as outras. Não há informações suficientes para concluir que o modelo está superajustando nas classes B e E sem ver as matrizes de confusão ou métricas de desempenho.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão