一位机器学习专家使用 SageMaker Clarify 发现,训练数据中 40-55 岁客户的样本数量明显少于其他年龄段。这代表了哪种类型的预训练数据偏差?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 类别不平衡 (CI).
为什么这是答案
正确答案是类别不平衡(CI)。类别不平衡是指数据集中某些类别的样本数量远少于其他类别,这正是题目中40-55岁客户样本数量明显偏少的情况。这种不平衡会导致模型在训练时偏向于样本量大的类别,从而在样本量小的类别上表现不佳。 标签比例差异(DPL)衡量的是不同敏感属性组之间预测标签的比例差异,与样本数量的绝对不平衡不同。条件人口统计差异(CDD)关注的是在给定特定条件下的敏感属性组之间的预测差异。Kolmogorov–Smirnov (KS) 检验是一种统计检验方法,用于比较两个样本分布是否来自同一分布,而不是一种偏差类型。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡