一位机器学习工程师在为分类模型准备数据时,注意到一些连续数值特征的值远大于其他特征。领域专家确认这些特征信息丰富,并且数据集具有代表性。然而,训练模型的准确性低于预期。哪个预处理步骤能最大程度地提高推理准确性?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 对值过大的特征进行归一化。.
为什么这是答案
当连续数值特征的取值范围差异很大时,模型(特别是基于距离的模型,如支持向量机、K近邻或神经网络)可能会过度关注取值较大的特征,从而导致模型性能不佳。归一化(Normalization)通过将所有特征缩放到相似的范围(例如0到1之间或均值为0、方差为1),确保每个特征对模型训练的贡献更加均衡,从而提高模型的推理准确性。 自举采样(bootstrap)主要用于评估模型的不确定性或构建集成模型,不能直接解决特征尺度不一致的问题。移除特征会丢失有价值的信息,因为领域专家已确认这些特征信息丰富。创建外推的合成特征可能会引入噪声或不准确性,尤其是在原始特征已经足够有信息量的情况下。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡