一家免費遊戲公司需要預測新使用者是否會在一年內成為付費客戶。帶有標籤的訓練集包含 1,000 個正樣本和 999,000 個負樣本(總計 1,000,000 個),具有 200 個特徵。隨機森林在訓練集上達到了 >99% 的準確度,但在測試集上表現不佳。團隊應該採取哪些措施來解決這個問題?(選擇兩項)
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 透過複製現有的正樣本並添加輕微雜訊來建立更多正樣本。, 修改損失函數,使假陰性比假陽性受到更嚴重的懲罰。.
為什麼這是答案
這個問題描述了嚴重的類別不平衡,導致模型在測試集上表現不佳。 複製現有的正樣本並添加輕微雜訊(過採樣)有助於平衡訓練集,讓模型有更多機會學習正類別的特徵,從而改善對少數類別的預測。 修改損失函數,使假陰性比假陽性受到更嚴重的懲罰,這在類別不平衡問題中非常重要,特別是當錯過正樣本(例如,潛在的付費客戶)的成本很高時。這會促使模型更傾向於預測正類別,減少假陰性。 增加隨機森林中樹的數量或深度可能導致過擬合,尤其是在已經過擬合的訓練集上。將測試集中的樣本複製到訓練集中會污染測試集,導致對模型泛化能力的評估不準確。修改損失函數使假陽性受到更嚴重的懲罰,則會導致模型更保守地預測正類別,增加假陰性,這與此問題的目標相反。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡