一家公司正在构建一个分类器,用于评估过去20年的月度销售业绩(1-5)。数据集包括月份、销售区域、区域总销售额和门店数量。每年有两个月的总销售额持续较高(季节性高峰)。在对分类特征进行独热编码和训练后,模型在验证集上的准确率低于预期。以下哪一步最有可能提高验证准确率?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用分层训练/验证拆分,以保留月份和销售区域的分布。.
为什么这是答案
公司的数据集包含季节性高峰(每年两个月销售额持续较高),并且有月份和销售区域等分类特征。如果使用随机拆分,训练集和验证集可能无法均匀地包含这些季节性高峰或特定区域的数据,导致模型在验证集上的表现不佳。分层训练/验证拆分可以确保训练集和验证集在月份和销售区域这些关键特征上保持相似的分布,从而使模型更好地学习和泛化。删除异常值可能有助于提高模型性能,但如果异常值代表了真实的业务情况,过度删除可能导致信息损失。全局或按区域标准化总销售额特征是常见的预处理步骤,有助于模型收敛,但对于解决因数据拆分不当导致的分布不平衡问题效果有限。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡