製薬会社が臨床試験サイトの文書(テキスト)を監査しており、監査人がレビューの優先順位を付けられるように、コーパス全体で上位10のトピックを発見する必要があります。有害事象に言及している文書は優先順位を付ける必要があります。データサイエンティストは、統計的トピックモデリングを使用して抽象的なトピックを見つけ、トピックごとに上位の単語をリストアップします。最適なアルゴリズムはどれですか?(2つ選択してください。)
解答を選択
オプションをタップして解答を確認してください。
正解: Latent Dirichlet Allocation (LDA), Neural topic modeling (NTM).
これが解答である理由
潜在的ディリクレ配分 (LDA) は、文書コレクション内の抽象的な「トピック」を識別するために使用される統計的トピックモデルです。各文書はトピックの混合として表現され、各トピックは単語の分布として表現されます。これにより、監査人は文書全体で上位10のトピックを発見し、各トピックの主要な単語をリストアップできます。ニューラルトピックモデリング (NTM) は、ニューラルネットワークを活用してトピックを学習する、LDAのより現代的な代替手段です。複雑なパターンを捉え、より表現力豊かなトピック表現を提供できます。ランダムフォレスト分類器と線形サポートベクターマシンは分類タスクに使用され、線形回帰は回帰タスクに使用されるため、このトピックモデリングのユースケースには適していません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要