1억 개의 레이블된 예제가 있는 NLP 회귀 문제입니다. 데이터는 무작위로 섞여 90/10으로 훈련/테스트 분할되었습니다. 훈련 RMSE가 테스트 RMSE보다 두 배 높습니다. 모델 성능을 어떻게 개선해야 할까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 추가 레이어를 도입하거나 사용되는 어휘 또는 n-그램의 크기를 늘리는 등 모델의 복잡성을 높입니다..
이것이 정답인 이유
훈련 RMSE가 테스트 RMSE보다 두 배 높다는 것은 모델이 훈련 데이터에 충분히 학습되지 못해 과소적합(underfitting) 상태임을 나타냅니다. 모델이 훈련 데이터의 패턴을 제대로 포착하지 못하고 있다는 의미입니다. 이러한 상황에서는 모델의 복잡성을 높여 학습 능력을 향상시켜야 합니다. 추가 레이어를 도입하거나, 더 큰 어휘 또는 n-그램을 사용하여 모델이 데이터의 미묘한 특징과 관계를 더 잘 학습할 수 있도록 하는 것이 효과적입니다. 다른 옵션들은 다음과 같은 이유로 적절하지 않습니다: 훈련-테스트 분할에서 테스트 샘플의 비율을 늘리는 것은 모델 성능 개선에 직접적인 도움이 되지 않습니다. 더 많은 데이터를 수집하는 것은 모델이 이미 과소적합 상태이므로, 현재 모델로는 추가 데이터의 복잡성을 처리하기 어렵습니다. 정규화 기법은 주로 과적합을 방지하는 데 사용되므로, 과소적합 상황에서는 오히려 모델의 학습 능력을 저해할 수 있습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음