정리된 데이터 세트에는 자릿수 단위로 크기가 다른 특징들이 있습니다. 프로덕션 환경에서 예측 정확도를 최대화하려면 모델링 전에 어떤 단계를 따라야 할까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 데이터 세트를 훈련, 검증 및 테스트 세트로 분할한 다음, 훈련 세트의 스케일을 조정하고 동일한 스케일링 파라미터를 검증 및 테스트 세트에 적용합니다..
이것이 정답인 이유
이 접근 방식은 데이터 유출을 방지하고 모델이 실제 환경에서 잘 일반화되도록 보장합니다. 먼저 데이터를 분할하면 테스트 세트가 스케일링 파라미터 학습에 사용되지 않아 모델의 성능을 편향되지 않게 평가할 수 있습니다. 훈련 세트에서 학습된 스케일링 파라미터를 검증 및 테스트 세트에 적용하면 일관된 변환이 이루어져 모델이 보지 못한 데이터에서도 정확하게 예측할 수 있습니다. 전체 데이터 세트의 스케일을 먼저 조정하면 테스트 세트의 정보가 스케일링 과정에 유출되어 모델 성능이 과대평가될 수 있습니다. 각 세트를 독립적으로 스케일링하면 데이터 분포의 일관성이 깨져 모델의 일반화 능력이 저하될 수 있습니다. 랜덤 샘플링은 불균형 데이터셋에 유용하지만, 스케일이 다른 특징 문제에 대한 직접적인 해결책은 아닙니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음