某公司正在為一個針對青少年的聊天機器人訓練一個客製化的大型語言模型。該聊天機器人應使用目標受眾的非正式風格,包括創意拼寫和縮寫。哪種評估指標適合評估模型的效能?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: BERTScore.
為什麼這是答案
BERTScore 適合評估生成式模型的語義相似度,特別是當模型輸出需要捕捉非正式風格、創意拼寫和縮寫時。它利用預訓練的 BERT 模型來計算生成文本與參考文本之間的語義相似度,而不是簡單的詞彙匹配,因此能更好地處理詞彙變體。 F1 score 衡量精確度和召回率的平衡,常用於分類任務,不適用於評估文本生成中的語義相似度。ROUGE 評估生成文本與參考文本之間的重疊單元(n-gram、詞序列或詞對),主要用於摘要任務,對詞彙變體不夠靈活。BLEU score 衡量生成文本與參考文本之間的 n-gram 重疊,常用於機器翻譯,但對非正式風格和創意拼寫的處理能力有限,且更側重於精確度而非語義。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡