一家信用卡公司需要即時偵測詐欺交易。一個帶有標籤的歷史資料集(詐欺與合法)儲存在 Amazon S3 中。在移除遺失值後,資料科學家在 Amazon SageMaker 中訓練了一個 XGBoost 分類器。模型指標為:TPR 0.700、FNR 0.300、TNR 0.977、FPR 0.023,以及整體準確度 0.949。考量到明顯的類別不平衡,資料科學家應該採取哪種行動來改善模型效能?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 對訓練集中的少數(詐欺)類別應用 SMOTE (Synthetic Minority Oversampling Technique),然後重新訓練模型。.
為什麼這是答案
此情境中,信用卡詐欺偵測通常面臨嚴重的類別不平衡問題,詐欺交易(少數類別)遠少於合法交易(多數類別)。當模型在不平衡資料上訓練時,它傾向於偏向多數類別,導致對少數類別的預測能力較差。SMOTE (Synthetic Minority Oversampling Technique) 是一種有效的過採樣技術,它透過在少數類別的樣本之間建立合成樣本來增加少數類別的數量,從而平衡訓練集。這有助於模型更好地學習少數類別的特徵,提高其對詐欺交易的偵測能力,特別是在保持較高真陽性率 (TPR) 的同時。 對多數類別應用 SMOTE 會進一步加劇類別不平衡。對少數類別進行欠採樣會丟失寶貴的詐欺交易資訊。對多數類別進行過採樣是不正確的,因為過採樣通常應用於少數類別。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡