무료 게임 회사는 신규 사용자가 1년 이내에 유료 고객이 될지 예측해야 합니다. 레이블이 지정된 훈련 세트에는 1,000개의 긍정적 예시와 999,000개의 부정적 예시(총 1,000,000개)가 200개의 특징과 함께 포함되어 있습니다. 랜덤 포레스트는 훈련 세트에서 99% 이상의 정확도를 달성했지만, 테스트 세트에서는 성능이 좋지 않습니다. 이 문제를 해결하기 위해 팀은 어떤 조치를 취해야 할까요? (두 가지 선택)
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 기존 긍정적 예시를 복제하고 약간의 노이즈를 추가하여 더 많은 긍정적 예시를 만듭니다., 오탐(false negatives)에 대한 페널티를 오분류(false positives)보다 더 크게 부과하도록 손실 함수를 수정합니다..
이것이 정답인 이유
이 시나리오는 극심한 클래스 불균형 문제를 나타냅니다. 긍정적 예시가 1,000개에 불과한 반면 부정적 예시는 999,000개입니다. 훈련 세트에서 99% 이상의 정확도를 달성했지만 테스트 세트에서 성능이 좋지 않다는 것은 모델이 부정적 클래스를 예측하는 데 편향되어 있음을 시사합니다. 1. 기존 긍정적 예시를 복제하고 약간의 노이즈를 추가하여 더 많은 긍정적 예시를 만듭니다. 이는 소수 클래스(긍정적 예시)를 오버샘플링하는 효과적인 방법입니다. 데이터 증강을 통해 모델이 긍정적 예시의 패턴을 더 잘 학습할 수 있도록 훈련 데이터를 늘립니다. 2. 오탐(false negatives)에 대한 페널티를 오분류(false positives)보다 더 크게 부과하도록 손실 함수를 수정합니다. 오탐(실제로는 유료 고객이 될 사람이 모델에 의해 유료 고객이 되지 않을 것으로 예측되는 경우)은 회사의 수익에 더 큰 영향을 미칠 수 있습니다. 손실 함수를 조정하여 오탐에 더 큰 가중치를 부여하면 모델이 긍정적 클래스를 더 잘 식별하도록 유도하여 클래스 불균형 문제를 완화할 수 있습니다. 랜덤 포레스트의 트리 수 또는 깊이를 늘리는 것은 과적합을 악화시키거나 계산 비용만 증가시킬 수 있습니다. 테스트 세트의 샘플을 훈련 세트에 복사하는 것은 데이터 유출이며 모델의 일반화 능력을 평가하는 것을 불가능하게 만듭니다. 오분류(false positives)에 대한 페널티를 오탐(false negatives)보다 더 크게 부과하는 것은 이 시나리오에서 바람직하지 않습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음