Está construyendo un modelo de regresión para predecir los resultados de los pacientes. En un conjunto de datos de 4000 pacientes (todos mayores de 65 años), 450 registros tienen la edad registrada como 0, mientras que otras características parecen razonables. ¿Cómo debe manejar estos valores de edad incorrectos?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Reemplazar los valores de edad de 0 con la edad media o mediana del conjunto de datos..
Por qué esta es la respuesta
Reemplazar los valores de edad de 0 con la media o mediana es la mejor opción porque la edad de 0 es claramente un error de entrada de datos, ya que todos los pacientes tienen más de 65 años. La imputación con la media o mediana preserva la mayor cantidad de datos posible, manteniendo la información valiosa de otras características para esos 450 pacientes. Eliminar estos registros reduciría el tamaño del conjunto de datos y podría introducir sesgos si los pacientes con edad 0 difieren sistemáticamente de los demás. Eliminar la característica de edad por completo es una pérdida significativa de información predictiva. K-means clustering no es una técnica de imputación directa para valores numéricos erróneos como este; se usa más para agrupar datos o para imputación de valores faltantes basada en similitud de grupos, no para corregir errores obvios.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta