一家信用卡公司需要实时检测欺诈性交易。一个带有标签的历史数据集(欺诈与合法)存储在 Amazon S3 中。在移除缺失值后,数据科学家在 Amazon SageMaker 中训练了一个 XGBoost 分类器。模型指标如下:TPR 0.700,FNR 0.300,TNR 0.977,FPR 0.023,总体准确率 0.949。考虑到明显的类别不平衡,数据科学家应该采取哪种措施来提高模型性能?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 对训练集中的少数(欺诈)类别应用 SMOTE (Synthetic Minority Oversampling Technique),然后重新训练模型。.
为什么这是答案
正确的做法是对训练集中的少数(欺诈)类别应用 SMOTE (Synthetic Minority Oversampling Technique),然后重新训练模型。 信用卡欺诈检测是一个典型的类别不平衡问题,欺诈交易(少数类)远少于合法交易(多数类)。在这种情况下,模型可能倾向于预测多数类,导致对少数类的识别能力差(如本例中FNR较高)。SMOTE通过生成少数类的新合成样本来平衡数据集,从而帮助模型更好地学习少数类的特征。 对训练集中的多数(合法)类别应用 SMOTE 是错误的,因为这会进一步加剧类别不平衡,使模型更难学习少数类。 对少数类别进行欠采样 是错误的,因为少数类别本身样本量就少,欠采样会丢失宝贵的欺诈信息。 对多数类别进行过采样 也是错误的,过采样多数类别同样会加剧不平衡问题。正确的做法是过采样少数类别或欠采样多数类别。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡