많은 특징을 가진 데이터 세트에 대해 선형 예측 모델(선형 또는 로지스틱 회귀 등)을 구축하고 있습니다. 탐색적 분석 결과, 많은 특징들이 높은 상관관계를 가지고 있으며, 이는 모델을 불안정하게 만들 수 있습니다. 상관관계가 높은 많은 특징을 가짐으로써 발생하는 부정적인 영향을 줄이기 위해 무엇을 해야 할까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 주성분 분석(PCA)을 사용하여 데이터를 새로운 저차원 특징 공간으로 변환합니다..
이것이 정답인 이유
주성분 분석(PCA)은 상관관계가 높은 많은 특징을 가진 데이터셋에서 발생하는 다중 공선성 문제를 해결하는 효과적인 방법입니다. PCA는 원래 특징들을 선형 변환하여 새로운 직교(상관관계 없는) 주성분으로 만듭니다. 이 주성분들은 데이터의 분산을 가장 잘 설명하며, 원래 특징 공간보다 더 적은 수의 차원으로 데이터를 표현할 수 있습니다. 이를 통해 모델의 안정성을 높이고 과적합을 줄일 수 있습니다. 상관관계가 높은 특징에 one-hot encoding을 적용하는 것은 범주형 데이터에 사용되는 기법이며, 이미 상관관계가 높은 수치형 특징의 문제를 해결하지 못합니다. 행렬 곱셈을 사용하여 특징을 결합하는 것은 특정 상황에서 유용할 수 있지만, 다중 공선성을 체계적으로 줄이는 일반적인 방법은 아닙니다. Pearson 상관 계수를 계산하는 것은 특징 간의 상관관계를 식별하는 데 사용되지만, 문제를 해결하는 방법은 아닙니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음