한 회사가 십대들을 대상으로 하는 챗봇을 위해 커스텀 대규모 언어 모델을 훈련하고 있습니다. 이 챗봇은 창의적인 철자와 약어를 포함하여 대상 사용자의 비공식적인 스타일을 사용해야 합니다. 모델의 성능을 평가하는 데 적합한 지표는 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: BERTScore.
이것이 정답인 이유
BERTScore는 생성된 텍스트와 참조 텍스트 간의 의미론적 유사성을 평가하는 데 적합합니다. 십대들의 비공식적인 언어 스타일(창의적인 철자, 약어 등)은 전통적인 단어 일치 기반 지표로는 정확하게 평가하기 어렵습니다. BERTScore는 문맥적 임베딩을 사용하여 이러한 미묘한 의미적 차이를 더 잘 포착하므로, 비표준 언어 사용이 많은 챗봇의 성능을 평가하는 데 이상적입니다. F1 score는 주로 분류 작업에 사용되며, 텍스트 생성에는 직접적으로 적합하지 않습니다. ROUGE와 BLEU는 n-그램 중첩을 기반으로 하므로, 창의적인 철자나 약어와 같이 참조 텍스트와 정확히 일치하지 않는 비표준 언어 사용에 대해서는 낮은 점수를 줄 수 있습니다. 이는 모델이 의도적으로 비표준 언어를 사용하는 경우 성능을 과소평가할 수 있습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음