데이터셋을 훈련 세트와 검증 세트로 무작위 분할하여 조류 분류 모델을 구축했습니다. 훈련 정확도는 매우 높지만 모델이 검증 세트에서 제대로 작동하지 않습니다. 원본 데이터셋의 균형이 맞지 않다는 것을 발견했습니다. 검증 성능을 개선하려면 어떻게 해야 합니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 훈련 및 검증 분할을 생성할 때 계층 샘플링을 사용합니다..
이것이 정답인 이유
모델의 훈련 정확도는 높지만 검증 세트에서 성능이 저조한 것은 과적합 또는 불균형 데이터 문제일 수 있습니다. 원본 데이터셋이 불균형하다는 점을 고려할 때, 훈련 및 검증 분할을 생성할 때 계층 샘플링을 사용하면 각 클래스의 비율이 훈련 및 검증 세트 모두에서 원본 데이터셋과 동일하게 유지됩니다. 이는 모델이 모든 클래스에 대해 공정하게 학습하고 평가되도록 하여 검증 성능을 개선합니다. 다수 클래스에 대한 데이터를 더 수집하는 것은 데이터 불균형을 악화시킬 수 있습니다. 훈련 데이터의 더 작은 무작위 하위 집합에서 훈련하는 것은 모델이 충분한 정보를 학습하지 못하게 할 수 있습니다. 체계적인 샘플링은 데이터의 특정 순서나 패턴에 따라 편향을 유발할 수 있습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음