Uma empresa está construindo um classificador para avaliar o desempenho de vendas mensais (1–5) dos últimos 20 anos. O conjunto de dados inclui mês, região de vendas, vendas agregadas regionais e número de lojas. Dois meses a cada ano mostram vendas agregadas consistentemente altas (picos sazonais). Após a codificação one-hot de recursos categóricos e o treinamento, a precisão do modelo no conjunto de validação é pior do que o esperado. Qual etapa provavelmente melhorará a precisão da validação?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Usar uma divisão estratificada de treino/validação que preserve as distribuições para mês e região de vendas..
Por que esta é a resposta
A divisão estratificada de treino/validação é crucial aqui porque o conjunto de dados possui picos sazonais consistentes (dois meses por ano com vendas altas) e dados de 20 anos, o que pode levar a um desequilíbrio na distribuição de meses e regiões se a divisão for aleatória. Preservar as distribuições de "mês" e "região de vendas" garante que tanto o conjunto de treino quanto o de validação contenham uma representação proporcional desses padrões, permitindo que o modelo aprenda e seja avaliado de forma mais precisa sobre os dados sazonais e regionais. Remover outliers pode descartar informações importantes sobre os picos de vendas sazonais, que são características do negócio. A normalização das vendas agregadas (globalmente ou por região) pode ser útil, mas não aborda o problema fundamental de uma distribuição desequilibrada nos conjuntos de treino/validação, que é a causa provável da baixa precisão inicial.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão