Un conjunto de datos saneado tiene características cuyas escalas difieren en órdenes de magnitud. Para maximizar la precisión de la predicción en producción, ¿qué secuencia de pasos debe seguir antes de modelar?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Dividir el conjunto de datos en conjuntos de entrenamiento, validación y prueba, luego reescalar el conjunto de entrenamiento y aplicar los mismos parámetros de escalado a los conjuntos de validación y prueba..
Por qué esta es la respuesta
La opción correcta es dividir primero el conjunto de datos y luego reescalar el conjunto de entrenamiento, aplicando los mismos parámetros de escalado a los conjuntos de validación y prueba. Esto evita la fuga de datos (data leakage), donde información del conjunto de prueba influye en el entrenamiento. Si reescalamos todo el conjunto primero, los parámetros de escalado se verían afectados por los datos de validación y prueba. Reescalar cada conjunto de forma independiente también introduce fuga de datos y puede llevar a inconsistencias. El muestreo aleatorio es una técnica útil, pero no aborda directamente el problema de las escalas de las características.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta