Uma empresa financeira global usa um modelo de regressão de gradient boosting para estimar as pontuações de crédito dos clientes. O conjunto de dados contém campos categóricos (por exemplo, cidade e status de moradia) e campos financeiros registrados em diferentes unidades (por exemplo, saldos em dólares e juros em centavos). A precisão do treinamento é de 99%, mas a precisão do teste é de 75%. Quais etapas de pré-processamento melhorarão mais o desempenho do modelo no teste?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Codificar os campos categóricos com one-hot encoding, padronizar os campos numéricos financeiros e aplicar regularização L1..
Por que esta é a resposta
A alta precisão de treinamento (99%) e baixa precisão de teste (75%) indicam overfitting. A codificação one-hot para variáveis categóricas é ideal para modelos baseados em árvore como gradient boosting, pois evita a introdução de uma ordem artificial que o label encoding criaria, o que poderia confundir o modelo. A padronização de campos numéricos com diferentes unidades (dólares vs. centavos) é crucial para que o modelo não atribua importância indevida a recursos com escalas maiores. A regularização L1 (Lasso) ajuda a reduzir o overfitting, penalizando coeficientes grandes e realizando seleção de features, o que é eficaz para modelos complexos. As outras opções são menos eficazes: Tokenização e binning são mais comuns para texto ou para lidar com distribuições não-normais, não sendo a melhor abordagem para este cenário. A remoção de outliers por z-score pode ser útil, mas não aborda diretamente o overfitting causado por escalas e codificação. Label encoding pode criar uma ordem ordinal artificial para dados nominais, prejudicando o desempenho. Aplicar regularização L1 apenas a campos numéricos e L2 ao modelo é uma abordagem menos integrada e pode não ser tão eficaz quanto a regularização L1 geral para seleção de features. Transformação logarítmica é para dados numéricos assimétricos, não categóricos. Imputar valores ausentes é importante, mas não aborda o overfitting ou a escala dos dados.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão