一個語言學習應用程式使用大型語言模型 (LLM) 來改寫文字,使其更具可讀性。訓練資料集包含原始文字及其更具可讀性的版本,而公司希望模型的輸出能與這些範例相符。他們應該使用哪種指標來評估模型的輸出與參考改寫的符合程度?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: ROUGE (Recall-Oriented Understudy for Gisting Evaluation) 分數.
為什麼這是答案
ROUGE 分數是評估文本摘要和機器翻譯等任務中生成文本與參考文本之間相似度的常用指標。它透過比較生成文本與參考文本之間重疊的單詞或短語來衡量召回率。在本情境中,應用程式旨在改寫文本以提高可讀性,並希望輸出與參考改寫版本相符,ROUGE 分數能有效評估這種符合程度。損失函數的值衡量模型訓練期間的錯誤,而非最終輸出的品質。語義穩健性衡量模型對輸入變化的敏感度,與文本改寫的符合度無直接關係。文本生成延遲衡量模型生成輸出的速度,與輸出內容的品質無關。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡