Un ingénieur ML entraîne un modèle de régression logistique pour prédire le taux de désabonnement. L'ensemble de données comprend deux caractéristiques de chaîne catégoriques : location (3 catégories distinctes) et job_seniority_level (plus de 10 catégories distinctes). Comment ces caractéristiques doivent-elles être prétraitées pour le modèle ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Utiliser l'encodage one-hot pour location. Utiliser l'encodage ordinal pour job_seniority_level..
Pourquoi c'est la réponse
L'encodage one-hot est approprié pour la caractéristique location car elle a un faible nombre de catégories distinctes (3) et il n'y a pas d'ordre intrinsèque entre elles. Cela crée des colonnes binaires distinctes pour chaque catégorie, évitant ainsi d'imposer un ordre artificiel. L'encodage ordinal est préférable pour jobsenioritylevel car il y a plus de 10 catégories distinctes, et il existe probablement un ordre naturel (par exemple, junior < senior < manager). L'encodage ordinal attribue un entier à chaque catégorie en fonction de cet ordre, ce qui est plus efficace que le one-hot pour un grand nombre de catégories ordonnées. Tokeniser la caractéristique location est généralement utilisé pour le texte libre, pas pour des catégories discrètes. Regrouper la caractéristique location n'est pas une technique de prétraitement standard pour des catégories. L'application d'une mise à l'échelle standard est utilisée pour les caractéristiques numériques continues, pas pour les caractéristiques catégoriques comme jobsenioritylevel.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise