환자 결과를 예측하는 회귀 모델을 구축하고 있습니다. 4,000명의 환자(모두 65세 이상) 데이터 세트에서 450개의 레코드에 연령이 0으로 기록되어 있지만 다른 특징들은 합리적으로 보입니다. 이 잘못된 연령 값을 어떻게 처리해야 할까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 연령 값 0을 데이터 세트의 평균 또는 중앙값 연령으로 대체합니다..
이것이 정답인 이유
연령이 0으로 기록된 450개의 레코드는 데이터 입력 오류를 나타냅니다. 이 레코드들을 단순히 제거하면 데이터 손실이 발생하여 모델의 학습 능력이 저하될 수 있습니다. 450개 레코드는 전체 4,000개 중 상당한 비율(11.25%)이므로 제거는 적절하지 않습니다. 연령이 0인 값을 데이터 세트의 평균 또는 중앙값으로 대체하는 것은 데이터 손실을 방지하면서 잘못된 값을 처리하는 일반적인 방법입니다. 특히 환자가 모두 65세 이상이므로 평균 또는 중앙값으로 대체하는 것이 합리적입니다. 연령 특징을 완전히 삭제하는 것은 중요한 정보를 잃게 되므로 모델 성능에 부정적인 영향을 미칠 수 있습니다. k-평균 클러스터링은 누락된 값을 대체하는 데 직접적으로 사용되는 방법이 아닙니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음