한 회사에서 다변수 선형 회귀를 사용하여 주택 판매 가격을 예측하려고 합니다. 데이터 세트에는 부지 면적, 주거 면적, 비주거 면적, 침실 수, 욕실 수, 건축 연도, 우편 번호와 같은 특징이 포함됩니다. 머신러닝 전문가는 관련 없는 특징을 제거하고 모델 복잡성을 줄이기 위해 어떤 절차를 사용해야 할까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 각 특징과 목표 판매 가격 간의 상관 관계를 계산하고 목표와 상관 관계가 거의 없는 특징을 제거합니다..
이것이 정답인 이유
정답은 각 특징과 목표 판매 가격 간의 상관 관계를 계산하고 목표와 상관 관계가 거의 없는 특징을 제거하는 것입니다. 이는 특징 선택의 일반적인 방법으로, 예측하려는 목표 변수(주택 판매 가격)와 관련성이 낮은 특징을 제거하여 모델 복잡성을 줄이고 성능을 향상시킵니다. 상관 관계가 낮다는 것은 해당 특징이 목표 변수의 변화를 설명하는 데 기여하는 바가 적다는 의미이므로 제거하는 것이 합리적입니다. 분산이 높은 특징을 제거하는 것은 일반적으로 올바른 접근 방식이 아닙니다. 분산이 높다는 것은 데이터가 넓게 퍼져 있다는 의미일 수 있으며, 이는 특징이 목표 변수에 중요한 정보를 제공할 수 있음을 나타낼 수도 있습니다. 반대로 분산이 낮은 특징을 제거하는 것도 항상 올바른 것은 아닙니다. 분산이 낮더라도 목표 변수에 중요한 영향을 미칠 수 있기 때문입니다. 특징 간 상관 관계의 히트맵을 생성하고 다른 특징과의 상호 상관 관계가 낮은 특징을 제거하는 것은 다중 공선성 문제를 해결하는 데 도움이 될 수 있지만, 목표 변수와의 관련성을 직접적으로 평가하는 방법은 아닙니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음