Um engenheiro de ML está treinando um modelo de regressão logística para prever a rotatividade de assinaturas. O conjunto de dados inclui duas características de string categóricas: location (3 categorias distintas) e job_seniority_level (mais de 10 categorias distintas). Como essas características devem ser pré-processadas para o modelo?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Use codificação one-hot para location. Use codificação ordinal para job_seniority_level..
Por que esta é a resposta
A codificação one-hot é ideal para 'location' porque tem poucas categorias (3), e não há uma ordem intrínseca entre elas. A codificação ordinal é adequada para 'jobsenioritylevel' porque, embora tenha muitas categorias (mais de 10), há uma ordem clara (e.g., júnior < pleno < sênior). Modelos de regressão logística podem se beneficiar da ordem implícita na codificação ordinal. Tokenizar 'location' é mais comum para texto livre, não para categorias fixas. Agrupar 'location' é uma técnica de redução de dimensionalidade, mas não o pré-processamento inicial. Escalonamento padrão é para características numéricas, não categóricas, tornando-o inadequado para 'jobsenioritylevel' neste contexto.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão