Une entreprise de jeux gratuits doit prédire si un nouvel utilisateur deviendra un client payant dans un délai d'un an. L'ensemble de données d'entraînement étiqueté contient 1 000 exemples positifs et 999 000 exemples négatifs (1 000 000 au total) avec 200 caractéristiques. Une forêt aléatoire a atteint une précision > 99 % sur l'ensemble d'entraînement, mais fonctionne mal sur l'ensemble de test. Quelles actions l'équipe devrait-elle prendre pour résoudre ce problème ? (Choisissez-en deux.)
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Créer plus d'exemples positifs en dupliquant les positifs existants et en y ajoutant un léger bruit., Modifier la fonction de perte pour pénaliser les faux négatifs plus lourdement que les faux positifs..
Pourquoi c'est la réponse
Le déséquilibre des classes est un problème majeur ici, avec seulement 1 000 exemples positifs sur 1 000 000. Une précision de 99 % peut être trompeuse si le modèle classe simplement tout comme négatif. La création d'exemples positifs supplémentaires par suréchantillonnage (duplication avec bruit) aide le modèle à mieux apprendre les caractéristiques des clients payants. De plus, pénaliser plus lourdement les faux négatifs (prédire qu'un client ne paiera pas alors qu'il le fera) est crucial, car ces clients sont ceux que l'entreprise souhaite identifier. Augmenter le nombre ou la profondeur des arbres sans résoudre le déséquilibre ne ferait qu'aggraver le surapprentissage. Copier des échantillons de test dans l'entraînement biaiserait l'évaluation. Pénaliser les faux positifs plus lourdement irait à l'encontre de l'objectif commercial.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise