SageMaker Data Wrangler를 사용하는 엔지니어가 철자 오류로 인해 수천 개의 약간 다른 값을 가진 텍스트 범주형 특징을 발견했습니다. 처리된 특징을 분류에 사용할 수 있도록 어떤 인코딩 방법을 사용해야 할까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 유사성 인코딩을 사용하여 철자가 비슷한 범주를 그룹화하고 나타냅니다..
이것이 정답인 이유
철자 오류로 인해 유사하지만 약간 다른 텍스트 범주형 특징이 있는 경우, 유사성 인코딩(Similarity Encoding)은 철자가 비슷한 범주들을 그룹화하고 단일 값으로 표현하여 데이터 품질을 향상시키고 모델이 패턴을 더 잘 학습하도록 돕습니다. 순서형 인코딩(Ordinal Encoding)은 범주 간에 순서 관계가 있을 때 적합하며, 여기서는 철자 오류를 해결하지 못합니다. 원-핫 인코딩(One-Hot Encoding)은 각 고유 범주에 대해 새로운 열을 생성하므로, 철자 오류로 인해 고유 범주 수가 많아지면 희소성 문제가 발생하고 모델 성능에 부정적인 영향을 줄 수 있습니다. 대상 인코딩(Target Encoding)은 범주를 대상 변수의 통계량으로 대체하지만, 철자 오류 자체를 해결하지는 못합니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음