一家製藥公司正在審核臨床試驗站點文件(文字),需要找出語料庫中的前 10 個主題,以便審核員可以優先審查。提及不良事件的文件必須優先處理。資料科學家將使用統計主題模型來尋找抽象主題並列出每個主題的熱門詞彙。哪些演算法最適合?(請選擇兩項。)
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: Latent Dirichlet Allocation (LDA), Neural topic modeling (NTM).
為什麼這是答案
LDA (Latent Dirichlet Allocation) 是一種生成式機率模型,廣泛用於發現文件集合中的抽象「主題」。它會將文件建模為主題的組合,並將主題建模為詞彙的組合,非常適合找出語料庫中的前 10 個主題及其熱門詞彙。NTM (Neural Topic Modeling) 是一種基於神經網路的主題模型,它利用深度學習技術來捕捉文件和詞彙之間更複雜的非線性關係,通常能產生比傳統統計模型更具連貫性和區分度的主題,因此也是一個合適的選擇。Random forest classifier 和 Linear support vector machine 是監督式學習演算法,用於分類任務,不適用於無監督的主題發現。Linear regression 是一種用於預測連續值的監督式學習演算法,也不適用於此情境。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡