公司在針對客服問題回答對大型語言模型進行微調後,希望衡量準確度是否有所提升。他們應該使用哪種評估指標?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: F1 score.
為什麼這是答案
F1 分數是衡量分類模型準確性的常用指標,特別適用於不平衡的資料集。它結合了精確度 (Precision) 和召回率 (Recall) 的加權平均值,能夠全面評估模型在識別正確答案方面的表現,同時考慮到假陽性 (false positives) 和假陰性 (false negatives)。對於客服問題回答的微調,F1 分數能有效反映模型在提供正確答案方面的整體效能。精確度 (Precision) 僅衡量模型預測為正例中實際為正例的比例,無法捕捉所有相關的正確答案。首次生成時間 (Time to first token) 衡量模型回應速度,而非準確性。詞錯誤率 (Word error rate) 主要用於語音辨識或機器翻譯,衡量文字轉錄或翻譯的錯誤,不適用於評估問答系統的準確性。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡