感情分析モデルの検証精度が低く、データサイエンティストは、平均単語頻度が低い非常に大規模な語彙が問題であると疑っています。検証精度を最も向上させる前処理またはメソッドはどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: テキストをTF-IDF特徴ベクトルに変換する(例えば、scikit-learnのTfidfVectorizerを使用する)。.
これが解答である理由
TF-IDF(Term Frequency-Inverse Document Frequency)は、各単語の重要度を評価する統計的手法です。単語の出現頻度(TF)と、その単語がどれだけ多くの文書で出現するか(IDFの逆数)を組み合わせることで、一般的な単語(例:ストップワード)の重みを下げ、特定の文書に特徴的な単語の重みを上げます。これにより、大規模な語彙の中から意味のある特徴を抽出し、モデルの精度向上に寄与します。 他の選択肢: Amazon Comprehendは高度なNLPサービスですが、感情分析の検証精度が低い根本原因(大規模な語彙と低頻度単語)に直接対処するものではありません。 Amazon SageMaker BlazingTextのCBOWモードは単語埋め込みを生成しますが、TF-IDFのように単語の重要度を直接的に重み付けするわけではありません。 NLTKによるステミングとストップワード削除は前処理として有効ですが、TF-IDFほど単語の重要度を効果的に特徴量として表現するものではありません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要