ある企業がテキスト要約タスクのために大規模言語モデルを比較しており、要約の品質を評価するための指標を必要としています。どの指標が適切ですか?
解答を選択
オプションをタップして解答を確認してください。
正解: Recall-Oriented Understudy for Gisting Evaluation (ROUGE).
これが解答である理由
ROUGE (Recall-Oriented Understudy for Gisting Evaluation) は、生成された要約と参照要約(人間が作成した要約)との間の単語の重複に基づいて、テキスト要約の品質を評価するために広く使用される指標です。ROUGE-N(N-グラムの重複)、ROUGE-L(最長共通部分列)、ROUGE-S(スキップグラム)など、複数のバリアントがあります。 Recallは、情報検索や分類タスクで関連アイテムがどれだけ取得されたかを示す指標であり、要約の品質を直接評価するものではありません。AUCは、二項分類モデルの性能を評価するために使用され、要約タスクには不適切です。MSEは、回帰タスクにおける予測値と実際の値との間の平均二乗誤差を測定するものであり、テキスト要約の評価には適用できません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要