한 ML 엔지니어가 구독 이탈을 예측하기 위해 로지스틱 회귀 모델을 훈련하고 있습니다. 데이터 세트에는 두 가지 범주형 문자열 특징이 포함되어 있습니다. location(3개의 고유 범주)과 job_seniority_level(10개 이상의 고유 범주)입니다. 모델을 위해 이러한 특징들을 어떻게 전처리해야 할까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: location에 원-핫 인코딩을 사용합니다. job_seniority_level에 서수 인코딩을 사용합니다..
이것이 정답인 이유
정답은 'location에 원-핫 인코딩을 사용합니다. jobsenioritylevel에 서수 인코딩을 사용합니다.'입니다. location과 같이 순서가 없는 범주형 특징(명목형)은 원-핫 인코딩을 사용하여 각 범주를 독립적인 이진 특징으로 변환하는 것이 일반적입니다. 이는 모델이 범주 간의 임의적인 순서를 가정하지 않도록 합니다. jobsenioritylevel과 같이 순서가 있는 범주형 특징(서수형)은 서수 인코딩을 사용하여 순서 관계를 숫자로 표현할 수 있습니다. 예를 들어, '주니어'를 1, '시니어'를 2, '리드'를 3 등으로 인코딩합니다. 오답 설명: 토큰화는 주로 텍스트 데이터에 사용되며, 고정된 범주형 특징에는 적합하지 않습니다. 비닝은 연속형 데이터를 그룹화하는 데 사용되며, 범주형 특징에는 일반적으로 적용되지 않습니다. 표준 스케일링은 연속형 숫자 특징의 분포를 조정하는 데 사용되며, 범주형 특징에는 적합하지 않습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음