감성 분석 모델의 검증 정확도가 낮고, 데이터 과학자는 평균 단어 빈도가 낮은 매우 큰 어휘가 문제라고 생각합니다. 어떤 전처리 또는 방법이 검증 정확도를 가장 잘 향상시킬까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 텍스트를 TF-IDF 특성 벡터로 변환합니다(예: scikit-learn의 TfidfVectorizer 사용)..
이것이 정답인 이유
정답은 텍스트를 TF-IDF 특성 벡터로 변환하는 것입니다. TF-IDF(Term Frequency-Inverse Document Frequency)는 문서 내 단어의 중요도를 측정하여, 자주 등장하지만 중요도가 낮은 불용어의 가중치를 낮추고 특정 문서에서만 자주 나타나는 단어의 가중치를 높여줍니다. 이는 어휘가 크고 단어 빈도가 낮은 문제에 효과적으로 대응하여 모델이 더 의미 있는 단어에 집중하도록 돕고, 결과적으로 모델의 검증 정확도를 향상시킵니다. 오답 설명: Amazon Comprehend를 사용하는 것은 구문 분석 및 개체 감지에 유용하지만, 단어 빈도 문제를 직접적으로 해결하여 감성 분석 정확도를 높이는 데는 한계가 있습니다. Amazon SageMaker BlazingText를 연속 BoW 모드에서 훈련하는 것은 단어 임베딩을 생성하지만, 단어 빈도 문제를 해결하기보다는 단어의 의미적 유사성을 학습하는 데 중점을 둡니다. NLTK를 사용하여 스테밍 및 불용어 제거를 적용하는 것은 전처리 단계에서 유용하지만, TF-IDF처럼 단어의 중요도를 고려하여 가중치를 부여하지는 않으므로, 큰 어휘와 낮은 단어 빈도 문제에 대한 해결책으로는 TF-IDF가 더 효과적입니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음