Usted entrena un clasificador de texto con un algoritmo de incrustación de palabras (word-embedding) incorporado. El conjunto de datos tiene cinco clases con estos recuentos de muestras: A=300, B=292, C=240, D=258, E=310. Usted mezcla y reserva el 10% para pruebas. Después del entrenamiento, se producen matrices de confusión para los conjuntos de entrenamiento y prueba. ¿Qué conclusión se puede extraer de estos resultados?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Las clases C y D son probablemente demasiado similares entre sí..
Por qué esta es la respuesta
La similitud entre las clases C y D es la conclusión más probable. Si un modelo tiene dificultades para diferenciar entre dos clases específicas, como se reflejaría en una matriz de confusión con muchos errores entre C y D, esto sugiere que las características que definen esas clases son muy parecidas. Un conjunto de datos de más de 1000 muestras es suficiente para un conjunto de validación. La distribución de clases no está muy sesgada, ya que los recuentos de muestras son relativamente equilibrados (entre 240 y 310). El sobreajuste generalmente se refiere a un rendimiento excelente en el conjunto de entrenamiento y pobre en el de prueba, no a problemas específicos con clases individuales sin más información.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta