使用 SageMaker Data Wrangler 时,一位工程师发现一个文本分类特征包含数千个因拼写错误而略有不同的值。应该使用哪种编码方法,以便处理后的特征可用于分类?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用相似性编码来分组和表示拼写相近的类别。.
为什么这是答案
当文本分类特征包含大量因拼写错误而略有不同的值时,相似性编码(Similarity Encoding)是最佳选择。它通过计算字符串之间的相似度(例如,使用Jaccard或Levenshtein距离)来识别并分组那些拼写相近但本质上代表相同概念的类别,从而有效减少特征的维度并提高模型性能。 序数编码(Ordinal Encoding)适用于类别之间存在内在顺序关系的情况,不适合处理拼写错误。独热编码(One-Hot Encoding)会将每个不同的拼写错误都视为一个独立的特征,导致特征维度爆炸,尤其是在有数千个独特值时,这会使模型训练变得低效且容易过拟合。目标编码(Target Encoding)虽然能有效处理高基数类别,但它仍然将每个拼写错误视为一个独立类别进行编码,无法解决拼写错误导致的数据冗余问题。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡