글로벌 금융 회사가 고객 신용 점수를 추정하기 위해 그라디언트 부스팅 회귀 모델을 사용합니다. 데이터 세트에는 범주형 필드(예: 도시 및 주택 상태)와 다른 단위로 기록된 금융 필드(예: 달러 잔액 및 센트 이자)가 포함되어 있습니다. 훈련 정확도는 99%이지만 테스트 정확도는 75%입니다. 모델의 테스트 성능을 가장 향상시킬 전처리 단계는 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 범주형 필드를 one-hot encode하고, 금융 숫자 필드를 표준화하며, L1 regularization을 적용합니다..
이것이 정답인 이유
정답은 범주형 필드를 one-hot encode하고, 금융 숫자 필드를 표준화하며, L1 regularization을 적용하는 것입니다. One-hot encoding은 범주형 데이터를 모델이 이해할 수 있는 숫자 형식으로 변환하여 모델 성능을 향상시키고, 표준화는 서로 다른 스케일의 금융 필드(달러 잔액, 센트 이자)가 모델 훈련에 미치는 영향을 균등하게 하여 모델의 수렴 속도를 높이고 안정성을 개선합니다. L1 regularization은 모델의 복잡성을 줄여 과적합(훈련 정확도 99%, 테스트 정확도 75%에서 나타남)을 방지하고 일반화 성능을 향상시키는 데 효과적입니다. 다른 옵션들은 다음과 같은 이유로 최적이 아닙니다. 토큰화는 텍스트 데이터에 주로 사용되며, 범주형 필드에는 적합하지 않습니다. binning은 정보 손실을 초래할 수 있고, z-score 필터링은 이상치를 제거하지만 과적합 문제 해결에는 직접적이지 않습니다. Label encoding은 범주 간에 순서 관계가 없는 경우 모델이 잘못된 순서를 학습할 수 있어 부적절하며, 숫자 필드에 L1 regularization을 적용하는 것은 일반적이지 않습니다. 로그 변환은 왜곡된 숫자 데이터에 사용되지만 범주형 필드에는 적합하지 않습니다. binning은 정보 손실을 야기할 수 있으며, 누락된 값 대체는 중요하지만 과적합 문제 해결에는 직접적이지 않습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음