Un modelo de análisis de sentimiento tiene una precisión de validación baja, y el científico de datos sospecha que un vocabulario muy grande con una frecuencia media de palabras baja es el problema. ¿Qué preprocesamiento o método mejoraría la precisión de la validación?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Convertir texto a vectores de características TF-IDF (por ejemplo, usando TfidfVectorizer de scikit-learn)..
Por qué esta es la respuesta
La conversión de texto a vectores TF-IDF (Term Frequency-Inverse Document Frequency) es una técnica eficaz para manejar vocabularios grandes y palabras de baja frecuencia. TF-IDF asigna pesos a las palabras, dando mayor importancia a las que son relevantes para un documento específico pero no tan comunes en el corpus general. Esto ayuda al modelo a centrarse en las palabras más discriminatorias, reduciendo el ruido de las palabras de baja frecuencia y mejorando la precisión. Usar Amazon Comprehend para análisis de sintaxis y detección de entidades es útil para extraer información, pero no aborda directamente el problema de un vocabulario grande y disperso. Entrenar con BlazingText en modo CBOW es para generar incrustaciones de palabras, lo cual es una buena técnica, pero TF-IDF es más directo para ponderar la importancia de las palabras en el contexto de la frecuencia. Aplicar stemming y eliminar stop words reduce el tamaño del vocabulario, pero no pondera la importancia de las palabras restantes de manera tan efectiva como TF-IDF, y podría eliminar información útil si no se hace con cuidado.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta