ある企業が、10代の若者を対象としたチャットボット向けにカスタム大規模言語モデルをトレーニングしています。このチャットボットは、創造的なスペルや略語を含む、対象ユーザーの非公式なスタイルを使用する必要があります。モデルのパフォーマンスを評価するのに適切なメトリックはどれですか?
解答を選択
オプションをタップして解答を確認してください。
正解: BERTScore.
これが解答である理由
BERTScoreは、単語の埋め込みと文脈を考慮してテキストの類似性を評価するため、創造的なスペルや略語を含む非公式な言語スタイルを評価するのに適しています。従来のメトリックとは異なり、BERTScoreは単語の完全一致を必要とせず、意味的な類似性を捉えることができます。 F1スコアは分類タスクでよく使用され、テキスト生成の品質評価には直接的ではありません。ROUGEとBLEUスコアは、主に機械翻訳や要約タスクで参照テキストとの単語の重なりに基づいて評価しますが、非公式な言語の創造的なバリエーションや同義語を適切に扱えません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要