SageMaker Data Wrangler を使用しているエンジニアが、スペルミスによってわずかに異なる数千の値を持ち、テキストのカテゴリカル特徴を発見しました。処理された特徴を分類に使用できるようにするには、どのエンコーディング方法を使用する必要がありますか?
解答を選択
オプションをタップして解答を確認してください。
正解: 類似性エンコーディングを使用して、スペルが近いカテゴリをグループ化して表現します。.
これが解答である理由
スペルミスによるわずかに異なる数千のカテゴリ値がある場合、類似性エンコーディング(またはファジィマッチング)は、スペルが近いカテゴリをグループ化して、データ品質の問題を解決し、特徴の数を減らすのに最も効果的です。これにより、モデルがより意味のあるパターンを学習できるようになります。順序エンコーディングはカテゴリ間に順序関係がある場合に適していますが、ここではスペルミスのあるテキストデータには不適切です。ワンホットエンコーディングは、数千ものユニークなカテゴリがある場合、次元の呪いを引き起こし、モデルのパフォーマンスを低下させる可能性があります。ターゲットエンコーディングは、カテゴリをターゲット変数の統計にマッピングしますが、スペルミスによる重複カテゴリの問題を直接解決しません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要