한 회사에서 지난 20년간의 월별 판매 실적(1-5)을 평가하는 분류기를 구축하고 있습니다. 데이터 세트에는 월, 판매 지역, 지역별 총 판매량, 매장 수가 포함됩니다. 매년 두 달은 총 판매량이 지속적으로 높게 나타납니다(계절적 급증). 범주형 특성을 원-핫 인코딩하고 학습시킨 후, 검증 세트에서의 모델 정확도가 예상보다 낮습니다. 어떤 조치가 검증 정확도를 가장 개선할 가능성이 높을까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 월 및 판매 지역에 대한 분포를 보존하는 계층화된 학습/검증 분할을 사용합니다..
이것이 정답인 이유
이 시나리오에서는 데이터에 계절적 급증(월)과 지역(판매 지역)이라는 중요한 구조가 있습니다. 무작위 분할은 이러한 중요한 패턴이 훈련 세트와 검증 세트에 고르게 분포되지 않게 할 수 있습니다. 계층화된 분할은 월과 판매 지역의 분포를 보존하여 훈련 세트와 검증 세트가 전체 데이터셋의 통계적 특성을 더 잘 대표하도록 합니다. 이는 모델이 일반화하는 능력을 향상시켜 검증 정확도를 높일 가능성이 큽니다. 이상치 제거는 모델 성능을 향상시킬 수 있지만, 계절적 급증과 같은 중요한 패턴을 제거할 위험이 있습니다. 총 판매량 특성을 정규화하는 것은 모델 수렴에 도움이 될 수 있지만, 데이터 분할의 불균형으로 인한 일반화 문제를 해결하지는 못합니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음