Um conjunto de dados higienizado possui características cujas escalas diferem em ordens de magnitude. Para maximizar a precisão da previsão em produção, qual sequência de etapas você deve seguir antes da modelagem?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Dividir o conjunto de dados em conjuntos de treinamento, validação e teste e, em seguida, reescalar o conjunto de treinamento e aplicar os mesmos parâmetros de escala aos conjuntos de validação e teste..
Por que esta é a resposta
A abordagem correta é dividir o conjunto de dados primeiro e depois reescalar. Isso evita o vazamento de dados (data leakage), onde informações do conjunto de teste ou validação influenciam o processo de reescalonamento, levando a uma superestimação do desempenho do modelo. Ao reescalar o conjunto de treinamento e aplicar os mesmos parâmetros de escala aos conjuntos de validação e teste, você simula o cenário de produção, onde o modelo encontrará dados não vistos. Amostragem aleatória não resolve o problema de escalas diferentes. Reescalar o conjunto de dados inteiro antes da divisão causaria vazamento de dados. Reescalar cada conjunto independentemente também causaria vazamento de dados, pois os parâmetros de escala de validação e teste seriam derivados de dados que deveriam ser "desconhecidos" para o processo de treinamento.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão