あるMLエンジニアが、サブスクリプションの解約を予測するためにロジスティック回帰モデルをトレーニングしています。データセットには、2つのカテゴリカルな文字列特徴量が含まれています。1つはlocation(3つの異なるカテゴリ)、もう1つはjob_seniority_level(10以上の異なるカテゴリ)です。これらの特徴量は、モデルのためにどのように前処理されるべきですか?
解答を選択
オプションをタップして解答を確認してください。
正解: locationにはワンホットエンコーディングを使用する。job_seniority_levelには順序エンコーディングを使用する。.
これが解答である理由
ロジスティック回帰は数値入力を必要とするため、カテゴリカル特徴量は数値に変換する必要があります。locationは3つの異なるカテゴリを持つ名義尺度であるため、カテゴリ間に順序関係はありません。この場合、ワンホットエンコーディングが適切です。各カテゴリに対して新しいバイナリ列を作成し、モデルがカテゴリ間の関係を誤って解釈するのを防ぎます。jobsenioritylevelは10以上の異なるカテゴリを持ち、ジュニアからシニアへの明確な順序関係があるため、順序エンコーディングが適しています。これにより、カテゴリの順序を保持したまま数値に変換できます。トークン化は自然言語処理で単語を数値に変換する際に使用され、ビニングは連続特徴量を離散化する際に使用されます。標準スケーリングは数値特徴量に適用されるため、カテゴリカル特徴量には不適切です。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要