Фармацевтическая компания проводит аудит документов (текстов) клинических испытаний и должна выявить 10 наиболее важных тем во всем корпусе, чтобы аудиторы могли расставить приоритеты при проверке. Документы, в которых упоминаются нежелательные явления, должны быть приоритезированы. Специалист по данным будет использовать статистическое тематическое моделирование для поиска абстрактных тем и составления списка наиболее важных слов для каждой темы. Какие алгоритмы лучше всего подходят? (Выберите два варианта ответа)
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Latent Dirichlet Allocation (LDA), Neural topic modeling (NTM).
Почему это правильный ответ
Latent Dirichlet Allocation (LDA) — это статистическая модель, которая используется для обнаружения абстрактных "тем" в коллекции документов. Она хорошо подходит для выявления скрытых тематических структур и ключевых слов для каждой темы, что соответствует требованиям задачи. Neural Topic Modeling (NTM) — это современный подход к тематическому моделированию, использующий нейронные сети для извлечения тем. NTM может быть более гибким и мощным, чем традиционные статистические методы, особенно для больших и сложных корпусов текстов. Random forest classifier и Linear support vector machine — это алгоритмы классификации, а не тематического моделирования. Linear regression — это алгоритм регрессии, используемый для прогнозирования числовых значений. Эти алгоритмы не подходят для выявления тем в текстовых данных.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется