데이터 과학자가 약 1,000만 개의 행과 10개의 특성을 가진 고용 데이터를 분석합니다. 소득 및 연령 분포는 모두 오른쪽으로 치우쳐 있습니다. 어떤 특성 변환이 왜곡을 수정하는 데 도움이 될까요? (두 가지 선택)
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 숫자 값 비닝, 로그 변환 적용.
이것이 정답인 이유
주어진 데이터에서 소득 및 연령 분포가 모두 오른쪽으로 치우쳐 있다는 것은 데이터가 정규 분포를 따르지 않고 양수 값에 더 집중되어 있음을 의미합니다. 이러한 왜곡은 많은 머신러닝 모델의 성능에 부정적인 영향을 미칠 수 있습니다. 로그 변환 적용: 로그 변환(예: log(x) 또는 log(x+1))은 오른쪽으로 치우친 분포를 대칭적인 형태로 변환하는 데 매우 효과적인 방법입니다. 큰 값들 사이의 간격을 줄여 데이터의 왜도를 감소시킵니다. 숫자 값 비닝: 숫자 값 비닝(Numerical Binning)은 연속적인 숫자 특성을 특정 구간(bin)으로 나누어 범주형 특성으로 변환하는 기법입니다. 이는 데이터의 이상치 영향을 줄이고, 비선형 관계를 선형화하는 데 도움을 주며, 왜곡된 분포를 보다 균일하게 만들 수 있습니다. 교차 검증은 모델 평가 기법이며, 고차 다항식 변환은 특성 간의 복잡한 관계를 모델링하는 데 사용되지만 왜도 수정에는 직접적인 관련이 없습니다. 원-핫 인코딩은 범주형 변수를 처리하는 방법입니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음