データサイエンティストは、顧客コメントの初期探索的分析をチャートとワードクラウドを使用して作成する必要があり、NLP モデルを構築する前に特徴量エンジニアリングを適用したいと考えています。視覚化とモデリングのためにテキストを準備するために使用すべき特徴量エンジニアリング手法を2つ選択してください。
解答を選択
オプションをタップして解答を確認してください。
正解: ステミング, 単語の頻度-逆文書頻度 (TF-IDF).
これが解答である理由
ステミングは、単語を語幹に還元することで、異なる活用形や派生形を同じ単語として扱えるようにします。これにより、データ量を削減し、分析の精度を高めることができます。TF-IDFは、文書内での単語の出現頻度と、コーパス全体での単語の希少性を考慮して、単語の重要度を数値化します。これにより、単語の重み付けが可能になり、視覚化や機械学習モデルの入力として適した形式に変換できます。 固有表現抽出と共参照解決は、テキストの意味理解を深める高度なNLPタスクであり、初期の探索的分析や特徴量エンジニアリングの段階で必須ではありません。感情分析は、テキストの感情を特定するもので、特徴量エンジニアリングというよりは、それ自体が分析タスクです。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要