您有一个包含10,000行和1,020个特征的表格数据集。数据中没有缺失值,重复项很少,并且大约有200对特征的相关性 > 0.9。特征的均值与中位数相似。在SageMaker中训练模型时,您应该采用哪种特征工程方法?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 通过应用主成分分析 (PCA) 来降低维度。.
为什么这是答案
正确答案是应用主成分分析 (PCA) 来降低维度。数据集中存在大量特征(1020个)以及约200对相关性大于0.9的特征,这表明数据存在高度冗余和多重共线性。PCA是一种有效的降维技术,它能将原始特征转换为一组不相关的正交主成分,同时保留数据中的大部分方差,从而解决多重共线性问题并提高模型训练效率和性能。 删除相关性低的特征通常不是一个好方法,因为低相关性不一定意味着特征不重要。异常检测(如Random Cut Forest)用于识别异常数据点,而不是处理特征冗余。将高度相关的特征连接在一起(例如,通过特征组合)可能增加特征数量和复杂性,而不是减少它们,且不一定能解决多重共线性问题。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡