一位 ML 工程師正在訓練一個羅吉斯迴歸模型,用於預測訂閱流失。資料集包含兩個類別字串特徵:location (3 個不同的類別) 和 job_seniority_level (超過 10 個不同的類別)。這些特徵應該如何為模型進行預處理?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 對 location 使用 one-hot encoding。對 job_seniority_level 使用序數編碼。.
為什麼這是答案
對於羅吉斯迴歸模型,類別特徵需要轉換為數值形式。One-hot encoding 適用於名目類別特徵,例如 location,因為它沒有固有的順序。它會為每個類別創建一個新的二元特徵,避免模型錯誤地推斷出順序關係。jobsenioritylevel 具有超過 10 個類別,且通常存在自然順序(例如:初級、中級、高級),因此序數編碼更為合適。序數編碼將每個類別映射到一個整數,保留了其順序資訊。 錯誤選項分析: 對 location 進行 Tokenize 不適用於羅吉斯迴歸,因為 Tokenize 通常用於文本數據,將單詞轉換為數字表示。 對 location 進行分箱不適用,因為 location 只有 3 個類別,分箱沒有意義。 對 jobsenioritylevel 應用標準化縮放不適用,因為標準化縮放是用於數值特徵的,而不是類別特徵。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡