Un ingeniero de ML está entrenando un modelo de regresión logística para predecir la rotación de suscripciones. El conjunto de datos incluye dos características de cadena categóricas: location (3 categorías distintas) y job_seniority_level (más de 10 categorías distintas). ¿Cómo se deben preprocesar estas características para el modelo?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Usar codificación one-hot para location. Usar codificación ordinal para job_seniority_level..
Por qué esta es la respuesta
La codificación one-hot es adecuada para 'location' porque tiene pocas categorías (3), creando nuevas columnas binarias sin implicar un orden. Esto evita que el modelo asuma relaciones numéricas inexistentes. La codificación ordinal es apropiada para 'jobsenioritylevel' porque, aunque tiene más categorías, estas probablemente tienen un orden inherente (ej. 'junior' < 'senior' < 'manager'). Asignar un valor numérico a cada nivel refleja esta jerarquía, lo que puede ser beneficioso para el modelo. Tokenizar 'location' es más común en procesamiento de lenguaje natural y no es lo ideal aquí. Agrupar 'location' podría perder información. El escalado estándar no es aplicable a características categóricas, ya que opera sobre valores numéricos continuos.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta