一家免费游戏公司需要预测新用户是否会在一年内成为付费客户。带标签的训练集包含 1,000 个正例和 999,000 个负例(总计 1,000,000 个),具有 200 个特征。随机森林在训练集上实现了 >99% 的准确率,但在测试集上表现不佳。团队应采取哪些措施来解决此问题?(选择两项)
选择一个答案
点击一个选项来检查您的答案。
正确答案: 通过复制现有正例并添加少量噪声来创建更多正例。, 修改损失函数,使对假阴性的惩罚比对假阳性的惩罚更重。.
为什么这是答案
该问题描述了一个高度不平衡的数据集,其中正例(付费客户)极少。随机森林在训练集上表现良好但测试集表现不佳,这表明模型过拟合了负例,并且无法有效识别稀有的正例。 “通过复制现有正例并添加少量噪声来创建更多正例”是正确的。这种方法称为过采样(oversampling),它通过增加少数类样本的数量来解决数据不平衡问题,使模型有更多机会学习正例的模式。 “修改损失函数,使对假阴性的惩罚比对假阳性的惩罚更重”是正确的。假阴性意味着模型错误地将付费客户预测为非付费客户,这对于游戏公司来说是错失收入。通过增加对假阴性的惩罚,模型会更倾向于识别正例,即使这可能导致一些假阳性(将非付费客户预测为付费客户)。 增加随机森林的树的数量或深度可能会加剧过拟合,因为模型已经过度学习了训练数据。将测试集样本复制到训练集会导致数据泄露,使评估结果不准确。修改损失函数使对假阳性的惩罚更重会进一步抑制模型识别正例,因为模型会更害怕错误地将非付费客户预测为付费客户,从而导致更多的假阴性。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡