一家全球性银行使用1,000条客户记录训练了一个客户流失模型,其中100条记录被标记为已流失客户。在SageMaker Data Wrangler中训练后,模型只预测负类(从不预测客户流失)。对训练数据进行什么更改最有可能解决此问题并生成更准确的客户流失预测?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 在训练前对训练集应用SMOTE (Synthetic Minority Oversampling Technique)。.
为什么这是答案
该问题描述了一个典型的类别不平衡问题:流失客户(少数类)的记录数量远少于非流失客户(多数类),导致模型倾向于预测多数类。SMOTE(合成少数类过采样技术)通过合成少数类的新样本来平衡数据集,从而使模型能够更好地学习少数类的特征,提高对流失客户的预测能力。 其他选项: 异常检测可能有助于提高模型整体性能,但不能直接解决类别不平衡导致的模型偏向。 特征归一化是数据预处理的常见步骤,有助于模型收敛和性能,但同样不能解决类别不平衡问题。 对多数类进行欠采样虽然也能平衡数据,但会丢弃部分多数类信息,可能导致模型泛化能力下降,不如SMOTE在保留信息方面表现好。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡