在对大型语言模型进行微调以回答帮助台查询后,公司希望衡量准确性是否有所提高。他们应该使用哪种评估指标?
选择一个答案
点击一个选项来检查您的答案。
正确答案: F1 score.
为什么这是答案
F1 分数是衡量分类模型准确性的指标,特别适用于不平衡数据集。它结合了精确率(Precision)和召回率(Recall),是两者的调和平均值。精确率衡量模型预测为正例的样本中有多少是真正的正例,而召回率衡量所有真正的正例中有多少被模型正确识别。在帮助台查询场景中,准确回答(正例)和错误回答(负例)可能不平衡,F1 分数能更全面地评估模型性能。 Precision(精确率)单独使用时,无法反映模型识别所有正例的能力。Time to first token(首字时间)是衡量模型响应速度的指标,与准确性无关。Word error rate(词错误率)主要用于语音识别或机器翻译,衡量文本转录或翻译的准确性,不适用于评估语言模型回答查询的整体准确性。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡