Una empresa farmacéutica audita documentos de sitios de ensayos clínicos (texto) y necesita descubrir los 10 temas principales en todo el corpus para que los auditores puedan priorizar las revisiones. Los documentos que mencionan eventos adversos deben priorizarse. Un científico de datos utilizará el modelado de temas estadístico para encontrar temas abstractos y listar las palabras principales por tema. ¿Qué algoritmos son los más adecuados? (Elija dos).
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Latent Dirichlet Allocation (LDA), Neural topic modeling (NTM).
Por qué esta es la respuesta
LDA es un algoritmo de modelado de temas estadístico que identifica temas abstractos en un corpus de documentos, mostrando las palabras principales asociadas a cada tema. Es ideal para descubrir los 10 temas principales y priorizar documentos. NTM es una técnica moderna de modelado de temas que utiliza redes neuronales para aprender representaciones de temas, ofreciendo a menudo resultados más matizados y de mayor calidad que los métodos estadísticos tradicionales, lo que también lo hace adecuado para esta tarea. Random forest, SVM y regresión lineal son algoritmos de clasificación o regresión, no de modelado de temas, por lo que no son apropiados para identificar temas abstractos en un corpus de texto.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta