一款语言学习应用使用大型语言模型(LLM)来改写文本,使其更具可读性。训练数据集包含原始文本及其更具可读性的版本,公司希望模型的输出与这些示例匹配。他们应该使用哪个指标来评估模型输出与参考改写文本的匹配程度?
选择一个答案
点击一个选项来检查您的答案。
正确答案: ROUGE (Recall-Oriented Understudy for Gisting Evaluation) 分数.
为什么这是答案
ROUGE (Recall-Oriented Understudy for Gisting Evaluation) 分数是评估文本摘要和机器翻译等任务中生成文本质量的常用指标。它通过比较模型输出与参考文本之间的重叠(例如,n-gram、词序列或词对)来衡量其相似度,这与该场景中评估改写文本与参考改写文本的匹配程度的目标高度吻合。损失函数的值是训练过程中的优化目标,不能直接衡量模型输出的质量。语义鲁棒性衡量模型在输入微小变化时输出是否保持一致,与文本匹配度无关。文本生成延迟是性能指标,而非质量指标。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡