一位数据科学家训练了一个XGBoost模型来标记欺诈性金融交易。训练集高度不平衡(100,000个非欺诈交易 vs. 1,000个欺诈交易)。在验证时,模型显示99.1%的准确率,但有太多的假阴性(将欺诈交易预测为非欺诈)。数据科学家应该采取哪两项措施来减少假阴性?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 增加XGBoost的scale_pos_weight,以赋予正例(欺诈)更高的权重。, 将XGBoost的eval_metric更改为优化ROC曲线下面积(AUC)。.
为什么这是答案
此场景中,模型准确率高但假阴性过多,表明模型未能有效识别少数类(欺诈交易)。 增加XGBoost的scaleposweight参数是正确的。这个参数用于处理不平衡数据集,通过增加少数类(欺诈交易)的权重,使模型在训练时更关注这些样本,从而减少假阴性。 将XGBoost的evalmetric更改为优化AUC也是正确的。准确率在高度不平衡数据集中具有误导性,因为它可能很高,即使模型对少数类预测很差。AUC(或AUPRC)是评估不平衡分类模型性能的更稳健指标,优化AUC会促使模型更好地区分正负类,从而减少假阴性。 优化RMSE(均方根误差)不适用于分类问题。增加或减小maxdepth主要用于解决过拟合或欠拟合问题,虽然可能间接影响性能,但并非直接解决假阴性过多的根本方法,特别是在不平衡数据集中。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡