Problema de regresión en PNL con 100M de ejemplos etiquetados; datos mezclados aleatoriamente y divididos 90/10 para entrenamiento/prueba. El RMSE de entrenamiento es el doble que el RMSE de prueba. ¿Cómo debería mejorar el rendimiento del modelo?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Aumentar la complejidad de su modelo, por ejemplo, introduciendo una capa adicional o aumentando el tamaño de los vocabularios o n-gramas utilizados..
Por qué esta es la respuesta
El problema describe que el RMSE de entrenamiento es el doble que el RMSE de prueba. Esto indica un subajuste (underfitting), donde el modelo no ha aprendido lo suficiente de los datos de entrenamiento y, por lo tanto, tiene un rendimiento deficiente tanto en el conjunto de entrenamiento como en el de prueba. Aumentar la complejidad del modelo (por ejemplo, añadiendo una capa adicional o aumentando el tamaño de los vocabularios o n-gramas) le permitiría capturar patrones más intrincados en los datos, reduciendo el subajuste y mejorando el rendimiento general. Las otras opciones son incorrectas: Aumentar la proporción de la muestra de prueba no aborda el subajuste y podría reducir la cantidad de datos disponibles para el entrenamiento, empeorando el problema. Recopilar más datos es útil para el sobreajuste, pero no para el subajuste, ya que el modelo ya tiene dificultades para aprender de los datos existentes. Las técnicas de regularización (dropout, batch normalization) se utilizan para prevenir el sobreajuste (overfitting), que es lo opuesto al problema presentado.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta