您使用内置的词嵌入算法训练了一个文本分类器。数据集包含五个类别,样本数量如下:A=300,B=292,C=240,D=258,E=310。您将数据集打乱并预留10%用于测试。训练完成后,生成了训练集和测试集的混淆矩阵。从这些结果中可以得出什么结论?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 类别 C 和 D 可能彼此过于相似。.
为什么这是答案
混淆矩阵显示了模型对每个类别的预测准确性,特别是哪些类别容易被误分类。如果类别 C 和 D 之间存在大量误分类(例如,许多 C 被预测为 D,或许多 D 被预测为 C),则表明这两个类别在特征空间中可能非常接近,即它们彼此过于相似。 其他选项不正确的原因: 数据集大小(约 1400 个样本)对于留出验证是足够的,且留出验证是评估模型性能的常用方法。 类别分布相对均衡(最小 240,最大 310),没有严重倾斜。 混淆矩阵本身无法直接判断模型在特定类别上是否过拟合,过拟合通常通过比较训练集和测试集上的性能差异来判断,而不是仅仅通过混淆矩阵。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡