Une entreprise pharmaceutique audite des documents de sites d'essais cliniques (texte) et doit découvrir les 10 principaux sujets de l'ensemble du corpus afin que les auditeurs puissent prioriser les examens. Les documents mentionnant des événements indésirables doivent être priorisés. Un scientifique des données utilisera la modélisation statistique de sujets pour trouver des sujets abstraits et lister les mots clés par sujet. Quels algorithmes sont les mieux adaptés ? (Choisissez-en deux.)
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Latent Dirichlet Allocation (LDA), Neural topic modeling (NTM).
Pourquoi c'est la réponse
LDA (Latent Dirichlet Allocation) est un algorithme de modélisation de sujets probabiliste largement utilisé qui identifie les thèmes abstraits (sujets) dans une collection de documents et attribue des mots clés à chaque sujet. Il est idéal pour découvrir les principaux sujets et les mots associés dans un grand corpus de texte. La modélisation de sujets neuronale (NTM) est une approche plus moderne qui utilise des réseaux de neurones pour la modélisation de sujets, offrant souvent une meilleure performance et une plus grande flexibilité que les méthodes traditionnelles comme LDA, en particulier avec des corpus complexes. Les classificateurs Random Forest et les SVM linéaires sont des algorithmes de classification supervisée, non adaptés à la découverte de sujets non supervisée. La régression linéaire est utilisée pour prédire une valeur continue, pas pour l'analyse de sujets.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise