一家公司将其工具生成的机器翻译与同一组文档的人工翻译进行比较。他们应该使用哪种评估策略来比较该工具相对于人工翻译的翻译质量?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用 Bilingual Evaluation Understudy (BLEU) 分数来估计这两种方法的相对翻译质量。.
为什么这是答案
正确的答案是使用 BLEU 分数来估计这两种方法的相对翻译质量。BLEU(Bilingual Evaluation Understudy)是一种广泛用于评估机器翻译质量的度量标准。它通过比较机器翻译文本与一个或多个高质量人工参考翻译文本之间的重叠度来工作,主要关注n-gram的精确度。BLEU 分数提供的是一个相对的质量指标,因为它将机器翻译与人工翻译进行比较,而不是提供一个绝对的、脱离上下文的质量评估。 BERTScore 也是一种评估机器翻译质量的度量标准,但它基于 BERT 嵌入,通过计算机器翻译与参考翻译之间语义相似度来评估。虽然 BERTScore 在某些方面可能比 BLEU 更能捕捉语义信息,但它同样提供的是相对质量评估,而不是绝对质量。因此,无论使用 BLEU 还是 BERTScore,它们都用于比较机器翻译与人工翻译的相对质量,而非绝对质量。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡