분류 모델을 위한 데이터를 준비하는 머신러닝 엔지니어가 일부 연속형 숫자 특성(feature)의 값이 다른 특성보다 훨씬 크다는 것을 발견했습니다. 도메인 전문가는 해당 특성들이 유익하며 데이터셋이 대표성이 있다고 확인했습니다. 훈련된 모델의 정확도가 예상보다 낮습니다. 어떤 전처리 단계가 추론 정확도를 가장 많이 향상시킬까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 불균형적으로 큰 값을 가진 특성들을 정규화합니다..
이것이 정답인 이유
정규화(Normalization)는 특성 스케일링의 한 형태로, 특성들의 값 범위를 일관되게 조정하여 모델이 특정 특성에 과도하게 의존하는 것을 방지합니다. 연속형 숫자 특성 중 일부가 다른 특성보다 훨씬 큰 값을 가질 경우, 모델(특히 경사 하강법 기반 모델)은 큰 값을 가진 특성에 더 큰 가중치를 부여하여 학습하게 되어 최적의 성능을 달성하지 못할 수 있습니다. 정규화를 통해 모든 특성이 유사한 스케일을 갖게 되면, 모델은 각 특성의 중요도를 더 정확하게 평가하고 학습할 수 있어 추론 정확도를 향상시킵니다. 부트스트랩(Bootstrap)은 표본 추출 기법으로 모델의 분산을 줄이는 데 사용될 수 있지만, 특성 값의 스케일 불균형 문제를 직접적으로 해결하지는 않습니다. 큰 값을 가진 특성들을 제거하는 것은 유익한 정보 손실로 이어질 수 있으므로, 도메인 전문가가 해당 특성들이 유익하다고 확인한 상황에서는 적절하지 않습니다. 외삽된 합성 특성 생성은 기존 특성들의 범위를 벗어나는 새로운 데이터를 만드는 것으로, 현재 문제인 스케일 불균형 해결과는 관련이 적습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음