어떤 언어 학습 앱이 LLM을 사용하여 텍스트를 더 읽기 쉽게 다시 작성합니다. 훈련 데이터셋에는 원본 텍스트와 더 읽기 쉬운 버전이 쌍으로 포함되어 있으며, 회사는 모델 출력이 이러한 예제와 일치하기를 원합니다. 모델 출력이 참조 재작성(reference rewrite)과 얼마나 밀접하게 일치하는지 평가하기 위해 어떤 지표를 사용해야 할까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: ROUGE(Recall-Oriented Understudy for Gisting Evaluation) 점수.
이것이 정답인 이유
ROUGE(Recall-Oriented Understudy for Gisting Evaluation) 점수는 생성된 텍스트가 참조 텍스트와 얼마나 일치하는지 평가하는 데 사용되는 일반적인 지표입니다. 특히 요약 및 텍스트 생성 작업에서 모델 출력이 참조 재작성(reference rewrite)과 얼마나 밀접하게 일치하는지 측정하는 데 적합합니다. 손실 함수의 값은 모델 훈련 중 성능을 나타내지만, 최종 출력의 품질을 직접적으로 평가하는 지표는 아닙니다. 의미론적 견고성은 모델이 입력의 작은 변화에도 일관된 의미를 유지하는 능력을 의미하며, 텍스트 일치도와는 다릅니다. 텍스트 생성 지연 시간은 모델이 텍스트를 생성하는 데 걸리는 시간을 측정하는 것으로, 출력의 품질과는 무관합니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음