一家全球性的金融公司使用梯度提升迴歸模型來估計客戶信用分數。資料集包含類別欄位(例如,城市和居住狀況)和以不同單位記錄的財務欄位(例如,以美元計的餘額和以美分計的利息)。訓練準確度為 99%,但測試準確度為 75%。哪些預處理步驟能最有效地提升模型的測試效能?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 對類別欄位進行 One-hot 編碼,標準化財務數值欄位,並應用 L1 regularization。.
為什麼這是答案
訓練準確度高但測試準確度低(過度擬合)是梯度提升模型常見的問題。One-hot 編碼能有效處理類別特徵,避免模型誤解其數值順序。標準化財務數值欄位(例如,使用標準差縮放)能確保不同單位的特徵在模型訓練時具有相似的尺度,防止尺度較大的特徵主導模型。L1 regularization(Lasso)透過將不重要特徵的係數壓縮為零來實現特徵選擇,有助於簡化模型並減少過度擬合。 其他選項: Tokenize 和分箱可能導致資訊損失或不必要的複雜性。z-score 過濾異常值可能移除有用的資料點。 Label-encode 會為類別特徵引入人工的數值順序,這對梯度提升模型來說通常是不合適的。對數值欄位應用 L1 regularization 和對模型應用 L2 regularization 的說法不夠精確,L1/L2 regularization 是對模型權重而非直接對欄位應用。 對數轉換通常用於處理偏斜的數值資料,而非類別欄位。填補遺失值是必要的,但單獨這項操作不足以解決過度擬合問題。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡