一位資料科學家訓練了一個 XGBoost 模型來標記詐欺性金融交易。訓練集高度不平衡(100,000 筆非詐欺交易對 1,000 筆詐欺交易)。在驗證時,模型顯示 99.1% 的準確度,但有太多誤報(將詐欺交易預測為非詐欺交易)。資料科學家應該採取哪兩項措施來減少誤報?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 增加 XGBoost 的 scale_pos_weight,以賦予正向(詐欺)範例更高的權重。, 將 XGBoost 的 eval_metric 更改為優化 ROC 曲線下面積 (AUC)。.
為什麼這是答案
由於資料集高度不平衡,模型儘管有高準確度(99.1%),卻產生過多誤報(將詐欺交易預測為非詐欺交易),這表示模型傾向於預測多數類別(非詐欺)。 增加 XGBoost 的 scaleposweight 參數可以為少數類別(詐欺交易)賦予更高的權重。這有助於模型更關注詐欺樣本,減少將其錯誤分類為非詐欺的可能性,從而降低誤報率。 將 evalmetric 設定為優化 ROC 曲線下面積 (AUC) 是另一種有效策略。AUC 是一種對類別不平衡問題更穩健的評估指標,它衡量模型區分正負類別的能力。優化 AUC 會促使模型在不同分類閾值下,平衡真陽性率和假陽性率,進而改善對詐欺交易的識別,減少誤報。 優化均方根誤差 (RMSE) 通常用於迴歸問題,不適用於此處的二元分類問題。增加或減少 maxdepth 主要是為了處理欠擬合或過擬合,與直接解決類別不平衡導致的誤報問題關聯較小。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡