한 회사에서 텍스트 요약 작업을 위해 대규모 언어 모델을 비교하고 있으며, 요약 품질을 평가할 지표가 필요합니다. 어떤 지표가 적절할까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: Recall-Oriented Understudy for Gisting Evaluation (ROUGE).
이것이 정답인 이유
ROUGE는 텍스트 요약 모델의 성능을 평가하는 데 널리 사용되는 지표입니다. 생성된 요약과 참조 요약(사람이 작성한 요약) 간의 단어, 구문 또는 문장 중복을 측정하여 요약의 품질을 객관적으로 평가합니다. Recall은 정보 검색에서 관련 항목을 얼마나 잘 찾아냈는지를 측정하지만, 요약의 전반적인 품질을 평가하기에는 부족합니다. AUC는 분류 모델의 성능을 평가하는 데 주로 사용됩니다. MSE는 회귀 모델의 예측 오차를 측정하는 데 사용되며, 텍스트 요약 품질 평가에는 적합하지 않습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음