AmazonAmazon ML Engineer Associate MLA-C01 Certification
·CN
·更新于 4 Aug 2026
DetectEye 运营一个欺诈模型,其中正类别占 0.3%,并计划在 SageMaker 上训练一个 XGBoost 模型。他们希望解决严重的类别不平衡问题,同时尽可能保留信号并避免标签噪声放大。在这种生产环境中,最适合首先尝试的两种干预措施是什么?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 在 SageMaker Processing 作业中,于预处理阶段对训练集应用 SMOTE(合成少数类过采样)(实现 imbalanced-learn),以在训练前增加少数类样本,同时验证合成样本的质量。, 在 SageMaker 训练作业中设置 XGBoost 的 scale_pos_weight(或在其他算法中使用 class_weight),以在不改变数据集分布的情况下,在目标函数中提高正样本的权重。.
为什么这是答案
SMOTE通过合成少数类样本来增加其数量,有效解决类别不平衡问题,同时避免简单复制带来的过拟合风险,且SageMaker Processing作业适合在训练前进行数据预处理。验证合成样本质量可确保信号保留。XGBoost的scaleposweight参数(或classweight)通过在损失函数中赋予少数类更高的权重来解决不平衡,无需改变原始数据分布,是处理不平衡数据集的常用且有效方法。
多数类随机欠采样至1:1会丢弃大量多数类样本,可能导致信息丢失,从而影响模型性能。使用Athena创建类似SMOTE的合成生成视图,不符合Athena的设计目的,且实时合成可能效率低下。禁用提前停止并增加学习率可能导致模型过拟合或训练不稳定,无法有效解决类别不平衡问题。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡