Vous construisez un modèle de régression pour prédire les résultats des patients. Dans un ensemble de données de 4 000 patients (tous âgés de plus de 65 ans), 450 enregistrements ont l'âge enregistré comme 0 alors que les autres caractéristiques semblent raisonnables. Comment devriez-vous gérer ces valeurs d'âge incorrectes ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Remplacer les valeurs d'âge de 0 par l'âge moyen ou médian de l'ensemble de données..
Pourquoi c'est la réponse
La substitution des valeurs d'âge de 0 par la moyenne ou la médiane est la meilleure approche. Étant donné que tous les patients ont plus de 65 ans, une valeur d'âge de 0 est clairement une erreur de saisie ou une donnée manquante. La suppression de ces 450 enregistrements (plus de 10 % de l'ensemble de données) entraînerait une perte d'informations précieuses provenant des autres caractéristiques. La suppression complète de la caractéristique d'âge est également une mauvaise idée, car l'âge est probablement un prédicteur important des résultats pour les patients. Le clustering k-means est une technique de regroupement non supervisé et n'est pas directement adapté pour l'imputation de valeurs manquantes dans ce scénario.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise