BERTScore最适合评估此场景中的模型性能,因为它能够捕获语义相似性,而不仅仅是精确的词语匹配。对于面向青少年的聊天机器人,非正式风格、创造性拼写和缩写意味着模型输出可能不会与参考答案完全匹配,但仍应传达相同的含义。BERTScore利用预训练的BERT模型生成词嵌入,从而更好地理解这种语义上的灵活性。
F1 score、ROUGE和BLEU分数主要侧重于词语重叠或n-gram匹配。虽然它们在某些文本生成任务中很有用,但它们会惩罚非正式语言中常见的创造性拼写和缩写,即使这些表达在语义上是正确的。因此,它们不适合评估这种风格化的语言。